# Anthropic và cuộc chiến điều kiển AI

Đăng ngày: 2026-07-03

Tôi theo dõi khá sát những diễn biến xoay quanh Anthropic và việc họ phải tạm dừng quyền truy cập vào hai mô hình AI mới nhất của mình, Claude Fable 5 và Claude Mythos 5. Mọi chuyện bắt nguồn từ Thứ Sáu, ngày 12 tháng 6, khi chính phủ Hoa Kỳ đột ngột áp dụng các biện pháp kiểm soát xuất khẩu. Lệnh này buộc Anthropic phải hạn chế truy cập đối với công dân nước ngoài, bất kể họ ở đâu. Vì lệnh có hiệu lực tức thì và việc xác minh quốc tịch theo thời gian thực gần như bất khả thi, Anthropic đành phải đình chỉ quyền truy cập của tất cả người dùng vào cả hai mô hình. Mãi đến ngày 30 tháng 6 vừa qua, những kiểm soát này mới được dỡ bỏ. Anthropic đã phát hành Fable 5 và Mythos 5 vào Thứ Ba, ngày 9 tháng 6. Cả hai đều dùng chung một mô hình nền tảng, nhưng Fable 5 được trang bị các cơ chế bảo vệ nghiêm ngặt hơn để an toàn cho mục đích sử dụng chung. Trong khi đó, Mythos 5, với ít lớp bảo vệ hơn, chỉ được cung cấp cho một nhóm nhỏ đối tác đáng tin cậy của Project Glasswing, phục vụ các tác vụ an ninh mạng phòng thủ. Lệnh kiểm soát xuất khẩu ngày 12 tháng 6 được ban hành sau khi chính phủ nhận được báo cáo từ các nhà nghiên cứu Amazon. Báo cáo này chỉ ra rằng họ đã tìm ra cách "vượt rào" các biện pháp an toàn của Fable 5, bằng cách yêu cầu mô hình này xác định nhiều lỗ hổng phần mềm. Đáng chú ý, trong một trường hợp, mô hình thậm chí còn tạo ra mã minh họa cách khai thác lỗ hổng đó. Sau sự việc, Anthropic đã làm việc chặt chẽ với chính phủ và các đối tác, bao gồm Amazon, để xem xét báo cáo và bằng chứng. Kết quả kiểm tra của họ khá thú vị: nhiều mô hình kém mạnh mẽ hơn, như Claude Opus 4.8, GPT-5.5 và Kimi K2.7, cũng có thể xác định các lỗ hổng tương tự Fable 5. Thậm chí, khi nói đến việc tạo ra mã khai thác cho một lỗ hổng cụ thể, mọi mô hình mà Anthropic thử nghiệm – từ Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8 đến GPT-5.4, GPT-5.5 và Kimi K2.7 – đều có thể tạo ra mã tương tự Fable 5. Điều này cho thấy kỹ thuật được báo cáo không phơi bày bất kỳ khả năng tấn công mạng độc đáo nào ở cấp độ Mythos. Hành vi đó chỉ phản ánh một trường hợp "ranh giới" đối với các biện pháp bảo vệ của Fable 5, liên quan đến công việc an ninh mạng phòng thủ thông thường – một loại nhiệm vụ tuy không quá nguy hiểm nhưng vẫn bị chặn bởi các cơ chế an toàn vì mục đích thận trọng. Dù vậy, Anthropic vẫn nhanh chóng hành động, đào tạo một bộ phân loại an toàn (safety classifier) cải tiến để chặn hành vi được mô tả trong báo cáo, đảm bảo người dùng sẽ được thông báo nếu yêu cầu bị chặn và được chuyển sang Opus 4.8. Bộ phân loại mới này chặn kỹ thuật cụ thể của báo cáo Amazon trong hơn 99% trường hợp, và ngay cả trong số ít trường hợp còn lại, thông tin cung cấp cũng không đủ chi tiết để giúp tin tặc. Trung tâm Tiêu chuẩn và Đổi mới AI (CAISI) thuộc Bộ Thương mại Hoa Kỳ cũng đã kiểm tra và xác nhận các biện pháp bảo vệ của Anthropic là "vô cùng mạnh mẽ". Tuy nhiên, cái giá phải trả là bộ phân loại mới này có thể gắn cờ nhầm các yêu cầu lành tính trong quá trình viết code và gỡ lỗi hàng ngày. Với việc kiểm soát đã được dỡ bỏ, Fable 5 sẽ có mặt rộng rãi từ Thứ Tư, ngày 1 tháng 7, cho người dùng toàn cầu trên các nền tảng Claude Platform, Claude.ai, Claude Code và Claude Cowork. Đối với các gói Pro, Max, Team và một số gói Enterprise chọn lọc, Fable 5 sẽ được bao gồm lên đến 50% giới hạn sử dụng hàng tuần đến hết ngày 7 tháng 7, sau đó sẽ chuyển sang sử dụng bằng credits. Anthropic cũng đang nhanh chóng khôi phục quyền truy cập trên AWS, Google Cloud và Microsoft Foundry. Riêng Mythos 5, quyền truy cập đã được khôi phục cho một số tổ chức Mỹ từ ngày 26 tháng 6, và Anthropic tiếp tục phối hợp với chính phủ để mở rộng cho các đối tác trong chương trình Glasswing.

Canonical: https://www.tungpham.vn/blog/anthropic-va-cuoc-chien-dieu-kien-ai
