Microsoft Incident Response cảnh báo rằng các hệ thống AI agent trong doanh nghiệp đang bước vào giai đoạn rủi ro mới: không chỉ đọc và tóm tắt dữ liệu, mà còn có thể gọi công cụ, truy vấn hệ thống nghiệp vụ và thực hiện hành động thay người dùng. Khi ranh giới này thay đổi, một mô tả công cụ bị đầu độc trong Model Context Protocol (MCP) có thể biến quy trình hợp lệ thành kênh rò rỉ dữ liệu.
Vấn đề được Microsoft gọi là MCP tool poisoning. Thay vì khai thác trực tiếp lỗ hổng trong mô hình hay nền tảng Copilot, kẻ tấn công chỉnh sửa phần mô tả tự nhiên của một công cụ MCP đã được phê duyệt. Agent đọc mô tả đó để quyết định khi nào và cách nào gọi công cụ, vì vậy một đoạn hướng dẫn độc hại có thể điều hướng hành vi của agent mà người dùng không nhìn thấy.

Điểm mới của rủi ro MCP tool poisoning
Trong các kịch bản prompt injection truyền thống, tác động thường dừng ở việc làm sai lệch câu trả lời hoặc khiến hệ thống tóm tắt nội dung theo hướng không mong muốn. Với AI agent có quyền hành động, tác động có thể đi xa hơn: truy vấn dữ liệu nhạy cảm, gửi tham số ra công cụ bên ngoài, tạo tài liệu, gửi email hoặc thay đổi lịch làm việc.
Microsoft mô tả một ví dụ trong quy trình tài chính. Một nhóm vận hành dùng agent để xử lý hóa đơn nhà cung cấp. Agent kết nối với dữ liệu nhà cung cấp nội bộ, email và một máy chủ MCP bên thứ ba dùng để làm giàu thông tin hóa đơn. Nếu máy chủ bên thứ ba cập nhật mô tả công cụ theo hướng độc hại, agent có thể bị yêu cầu âm thầm lấy danh sách hóa đơn chưa thanh toán, tóm tắt dữ liệu đó và đính kèm vào lệnh gọi công cụ dưới vỏ bọc kiểm tra gian lận.
Vì sao hành vi này khó phát hiện?
Điểm nguy hiểm nằm ở chỗ từng hành động riêng lẻ đều có vẻ hợp lệ. Công cụ đã được cho phép, truy vấn dữ liệu kế thừa quyền của người dùng, còn kết nối outbound đi tới máy chủ đã nằm trong danh sách được phê duyệt. Nếu hệ thống chỉ kiểm tra quyền truy cập tĩnh, chuỗi hành vi có thể không tạo cảnh báo rõ ràng.
The Hacker News tóm lược vấn đề này là tình huống agent không nhất thiết phá vỡ quy tắc, nhưng vẫn làm lộ dữ liệu vì quy tắc vận hành đã bị tác động từ metadata của công cụ. Nói cách khác, mô tả công cụ không còn là tài liệu vô hại; trong bối cảnh agentic AI, nó có thể hoạt động gần giống một phần của system prompt.
Bài học cho doanh nghiệp triển khai AI agent
Bài học đầu tiên là xem mọi máy chủ MCP và mọi connector có quyền hành động như một thành phần của chuỗi cung ứng phần mềm. Doanh nghiệp cần kiểm kê nguồn phát hành, chủ sở hữu, phạm vi dữ liệu, quyền hành động và lịch sử thay đổi metadata của từng công cụ trước khi đưa vào môi trường sản xuất.
Bài học thứ hai là áp dụng nguyên tắc least agency, không chỉ least privilege. Một agent có ít quyền vẫn có thể gây hại nếu được tự động gọi quá nhiều công cụ, gửi tham số ra ngoài hoặc thực hiện hành động nhạy cảm mà không cần xác nhận của con người. Với dữ liệu tài chính, dữ liệu khách hàng hoặc thay đổi tài khoản, cơ chế phê duyệt thủ công vẫn là lớp kiểm soát cần thiết.
Khuyến nghị kiểm soát thực tế
Microsoft khuyến nghị duy trì danh sách cho phép ở cấp tenant đối với publisher và MCP server, tắt cơ chế cho phép tất cả công cụ, đồng thời chỉ bật những công cụ agent thật sự cần. Mọi thay đổi mô tả công cụ trong môi trường sản xuất nên được rà soát như thay đổi system prompt, nhất là khi metadata chứa câu lệnh mang tính bắt buộc, yêu cầu thu thập dữ liệu hoặc mở rộng phạm vi tham số.
Các tổ chức cũng nên giám sát tham số của lệnh gọi công cụ bằng DLP, dùng cơ chế bảo vệ prompt để kiểm tra nội dung đi vào ngữ cảnh agent, đồng thời đưa telemetry từ MCP server, agent runtime và hệ thống SIEM vào cùng một chuỗi phân tích. Những tín hiệu như agent đột ngột gọi endpoint mới, gửi payload lớn bất thường hoặc truy vấn dữ liệu ngoài phạm vi yêu cầu ban đầu cần được xem là dấu hiệu điều tra.
Conclusion
MCP tool poisoning cho thấy bảo mật AI agent không thể chỉ dựa vào kiểm soát mô hình. Khi agent được phép hành động, metadata của công cụ, connector bên thứ ba và quy trình phê duyệt thay đổi trở thành một phần trực tiếp của bề mặt tấn công. Doanh nghiệp cần quản trị agent như quản trị một hệ thống sản xuất có quyền truy cập dữ liệu thật, hành động thật và rủi ro vận hành thật.
VNCyberS tổng hợp từ Microsoft Security Blog và The Hacker News















