Các nhà nghiên cứu của Anthropic và EPFL Thụy Sĩ vừa công bố một hướng rủi ro mới trong hệ sinh thái AI agent: payload tự lan truyền, được nhóm gọi là mind virus, có thể đi từ agent này sang agent khác thông qua những file prompt bền vững được dùng để lưu trạng thái giữa các phiên làm việc.
The Hacker News cho biết nghiên cứu được phát hành dưới dạng preprint ngày 10/8/2026. Nhóm thử nghiệm kỹ thuật này trong một môi trường cộng tác gồm sáu agent viết mã và một chuỗi agent ghép cặp mô phỏng theo OpenClaw, nơi các file như MEMORY.md hoặc SOUL.md được nạp lại vào system prompt mỗi khi bắt đầu phiên mới.

Mind virus AI là gì
Trong bối cảnh nghiên cứu, mind virus không phải là mã độc truyền thống chạy trực tiếp trên hệ điều hành. Đây là những đoạn chỉ thị được thiết kế để thuyết phục agent ghi lại một niềm tin, mục tiêu hoặc hành vi vào file có tính bền vững. Khi agent sau đọc lại file đó như một phần của ngữ cảnh hệ thống, payload có cơ hội được tiếp nhận và tiếp tục được sao chép.
Nhóm nghiên cứu phân loại payload thành hai nhóm chính. Nhóm thứ nhất mang tính tư tưởng, nhằm cấy một niềm tin hoặc mục tiêu vào agent. Nhóm thứ hai mang tính hành động, yêu cầu agent thực hiện một hành vi cụ thể. Trong các thử nghiệm, payload được tối ưu qua vòng tiến hóa, chủ yếu dùng Kimi K2.5 làm công cụ tạo biến thể vì một số mô hình khác từ chối tạo payload kiểu này.
Kết quả thử nghiệm đáng chú ý
Theo bài viết gốc, những agent ghi payload vào SOUL.md chiếm 88% số lần cố gắng lan truyền và thành công lây sang agent tiếp theo trong 55% trường hợp. Khi payload nằm trong một file workspace thông thường, tỷ lệ cố gắng giảm còn 12% và tỷ lệ thành công là 17%.
Trong các chuỗi 20 bước, khi mọi file trừ SOUL.md bị xóa ở mỗi bước, cả bốn payload hành động vẫn tồn tại tới bước cuối. Một số biến thể ở bước thứ 20 còn có khả năng lây sang agent mới tốt hơn payload ban đầu, do ngôn ngữ đã được làm mềm hoặc được gắn với một nguồn có vẻ đáng tin hơn.
Chưa có bằng chứng lan truyền ngoài đời thực
Dù kết quả trong phòng thí nghiệm đáng chú ý, nghiên cứu không khẳng định mind virus AI đã lan thành công trong thực tế. Khi nhóm rà soát kho bài đăng Moltbook, một mạng xã hội dành cho AI agent, họ lọc được khoảng 2.000 ứng viên có dấu hiệu cố gắng lan truyền từ khoảng 400 tác giả nhưng không tìm thấy chuỗi lây nhiễm agent-to-agent thành công.
Trên bản sao cục bộ của nền tảng này, các phương pháp tiến hóa tương tự cũng không tạo được payload có thể lây tới agent ở bước thứ hai thông qua bài đăng công khai. Vì vậy, rủi ro hiện tại được mô tả là có thật nhưng còn giới hạn, phụ thuộc mạnh vào cấu hình agent, mô hình sử dụng và mức độ tin cậy dành cho nguồn dữ liệu đầu vào.
Một cảnh báo ngắn có thể giảm rủi ro mạnh
Một phát hiện thực dụng là cảnh báo chỉ dài một đoạn trong system prompt có thể kéo tỷ lệ lan truyền xuống gần bằng 0 trong các payload đã kiểm thử. Sau 15 thế hệ tối ưu đối kháng với hơn 150 payload ứng viên trên Claude Haiku 4.5, nhóm không tạo được biến thể nào vượt quá một bước lây lan khi cảnh báo này được thêm vào.
Điều đó cho thấy các agent không chỉ cần sandbox và phân quyền tệp tin, mà còn cần chính sách đọc ngữ cảnh rõ ràng: không tự động tin file bền vững, không sao chép chỉ thị nhận được từ agent khác, và phải phân biệt dữ liệu tham khảo với chỉ thị vận hành.
Bài học cho tổ chức dùng AI agent
Các doanh nghiệp đang triển khai agent tự động nên rà soát các cơ chế lưu trí nhớ dài hạn, file cấu hình cá nhân hóa, transcript giữa agent và workflow chia sẻ workspace. Những nơi này có thể trở thành kênh truyền chỉ thị ngoài ý muốn nếu agent được quyền đọc, sửa và kế thừa nội dung mà không có lớp xác thực hoặc kiểm duyệt.
Về vận hành, cần giới hạn quyền ghi vào file prompt bền vững, tách dữ liệu do người dùng cung cấp khỏi system instruction, log lại thay đổi trong file nhớ, và yêu cầu xác nhận thủ công với các hành động có tác động lớn như xóa tệp, thay đổi cấu hình bảo mật hoặc truyền chỉ thị sang agent khác.
Kết luận
Mind virus AI là lời nhắc rằng bảo mật agent không chỉ nằm ở mô hình nền, mà còn nằm ở vòng đời dữ liệu xung quanh mô hình. Khi agent có trí nhớ, quyền ghi file và khả năng phối hợp với agent khác, prompt có thể trở thành một dạng bề mặt tấn công cần được kiểm soát như cấu hình hệ thống.
VNCyberS tổng hợp từ The Hacker News, Anthropic và nghiên cứu Mind Viruses















