
Ngày 7 tháng 4 năm 2026, Anthropic chính thức công bố Claude Mythos Preview, mô hình ngôn ngữ thế hệ mới với khả năng bảo mật mà công ty gọi là “bước ngoặt có thể định hình lại toàn bộ ngành an ninh mạng”. Cùng với đó, Anthropic ra mắt Project Glasswing, một liên minh gồm hơn 45 tổ chức công nghệ và bảo mật hàng đầu thế giới, để chuẩn bị cho những tác động to lớn mà mô hình này có thể mang lại.
Khi AI tự tìm ra lỗ hổng mà con người bỏ sót
Claude Mythos Preview không được Anthropic huấn luyện đặc biệt cho bảo mật. CEO Dario Amodei giải thích rằng nhóm chỉ đơn giản là huấn luyện mô hình giỏi về code, và khả năng bảo mật nổi bật là hệ quả tự nhiên từ đó. Tuy nhiên, kết quả đạt được trong quá trình kiểm thử nội bộ khiến ngay cả đội ngũ Anthropic cũng bất ngờ.
Trong các thử nghiệm, Mythos Preview có thể tự phát hiện và khai thác lỗ hổng zero-day trên mọi hệ điều hành lớn và mọi trình duyệt phổ biến. Nhiều lỗi trong số này đã tồn tại hàng chục năm mà không bị phát hiện. Lỗi cũ nhất được ghi nhận là một lỗ hổng 27 năm tuổi trong OpenBSD, hệ điều hành vốn nổi tiếng là một trong những hệ thống an toàn nhất thế giới.
Mô hình không chỉ tìm ra các lỗ hổng đơn lẻ. Trong một trường hợp, Mythos Preview tự viết một exploit cho trình duyệt web bằng cách kết hợp bốn lỗ hổng riêng biệt, sử dụng kỹ thuật JIT heap spray phức tạp để thoát khỏi cả sandbox của renderer lẫn hệ điều hành. Ở một trường hợp khác, mô hình tự viết mã khai thác thực thi lệnh từ xa trên máy chủ NFS của FreeBSD, cho phép người dùng chưa xác thực giành quyền root.
Điều đáng chú ý hơn là ngay cả người không có nền tảng bảo mật chuyên sâu cũng có thể sử dụng Mythos Preview để thực hiện những việc tương tự. Các kỹ sư tại Anthropic không có đào tạo bảo mật chính thức đã thử nghiệm: họ yêu cầu mô hình tìm lỗ hổng thực thi mã từ xa rồi đi ngủ, và sáng hôm sau có sẵn một exploit hoàn chỉnh đang chờ.
Khoảng cách thế hệ so với mô hình trước
Để hình dung mức độ cải thiện, nhóm nghiên cứu Anthropic so sánh trực tiếp với Opus 4.6, phiên bản mô hình trước đó. Trong bài kiểm tra với engine JavaScript của Firefox 147, Opus 4.6 thành công khai thác chỉ 2 lần trong vài trăm lần thử. Mythos Preview thực hiện thử nghiệm tương tự và thành công 181 lần, cộng thêm 29 lần đạt được register control.
Đội ngũ red team của Anthropic cũng phát triển các scaffold cho phép Mythos Preview tự động chuyển đổi từ lỗ hổng đã biết thành exploit mà không cần can thiệp của con người. Anthropic xác nhận đã tìm thấy hàng nghìn lỗ hổng nghiêm trọng trong quá trình kiểm thử, hơn 99% trong số đó chưa được vá nên không thể công bố chi tiết theo chính sách tiết lộ có phối hợp của công ty.
Project Glasswing, liên minh phòng thủ trước khi quá muộn
Đặt tên theo loài bướm có cánh trong suốt, Project Glasswing là sáng kiến của Anthropic nhằm cho phép các tổ chức quan trọng sử dụng Mythos Preview để rà soát hệ thống của chính họ trước, trước khi mô hình hoặc các mô hình tương đương trở nên có sẵn rộng rãi hơn.
Liên minh bao gồm Microsoft, Apple, Google, Amazon Web Services, Linux Foundation, Cisco, Nvidia, Broadcom và hơn 40 tổ chức khác trong lĩnh vực công nghệ, bảo mật, cơ sở hạ tầng trọng yếu và tài chính. Tất cả đều có quyền truy cập riêng vào mô hình để tự kiểm tra và vá lỗ hổng trên nền tảng của mình trước khi bị kẻ tấn công khai thác.
“Thông điệp thực sự không phải về mô hình hay Anthropic”, Logan Graham, trưởng nhóm frontier red team của công ty, nói với Wired. “Chúng ta cần chuẩn bị ngay từ bây giờ cho một thế giới mà những khả năng này trở nên phổ biến trong 6, 12, 24 tháng tới. Nhiều thứ trong bảo mật sẽ thay đổi. Nhiều giả định mà chúng ta đã dùng để xây dựng các mô hình bảo mật hiện đại có thể sụp đổ.”
Microsoft CISO toàn cầu Igor Tsyganskiy đánh giá cao sáng kiến này: “Tham gia Project Glasswing cho phép chúng tôi xác định và giảm thiểu rủi ro sớm, cũng như nâng cao các giải pháp bảo mật để bảo vệ khách hàng tốt hơn.”
Nguy cơ kép và bài toán chưa có lời giải
Sự xuất hiện của Mythos Preview đặt ra một nghịch lý quen thuộc trong ngành bảo mật, nhưng ở quy mô chưa từng thấy: cùng một công cụ có thể phục vụ cả người phòng thủ lẫn kẻ tấn công. Anthropic đã quyết định không phát hành mô hình ra công chúng, nhưng thừa nhận rằng các mô hình mạnh tương tự chắc chắn sẽ xuất hiện từ các công ty khác trong thời gian không xa.
“Nếu làm không cẩn thận, đây có thể là chất xúc tác đáng kể cho kẻ tấn công”, Graham cảnh báo. Chính vì vậy, toàn bộ cấu trúc của Project Glasswing được xây dựng theo mô hình tiết lộ lỗ hổng có phối hợp, cho phép bên phòng thủ có thời gian vá lỗi trước khi thông tin được công khai.
Anthropic cho biết mục tiêu cuối cùng là phát triển các phương pháp để triển khai mô hình Mythos-class an toàn ở quy mô rộng hơn, nhưng chưa có lộ trình cụ thể. Điều cấp bách nhất lúc này, theo Graham, là các tổ chức trong liên minh phải xác định được những câu hỏi cần trả lời, rồi mới tìm câu trả lời. “Project Glasswing chỉ là điểm khởi đầu. Nó sẽ thất bại nếu chỉ là một nhóm nhỏ công ty dùng một mô hình. Nó phải phát triển thành thứ gì đó lớn hơn nhiều.”
VNCyberS tổng hợp từ: Wired, Anthropic Red Team Blog, The Verge














