Anthropic và cuộc chiến điều kiển AI
Tôi theo dõi khá sát những diễn biến xoay quanh Anthropic và việc họ phải tạm dừng quyền truy cập vào hai mô hình AI mới nhất của mình, Claude Fable 5 và Claude Mythos 5. Mọi chuyện bắt nguồn từ Thứ Sáu, ngày 12 tháng 6, khi chính phủ Hoa Kỳ đột ngột áp dụng các biện pháp kiểm soát xuất khẩu. Lệnh này buộc Anthropic phải hạn chế truy cập đối với công dân nước ngoài, bất kể họ ở đâu. Vì lệnh có hiệu lực tức thì và việc xác minh quốc tịch theo thời gian thực gần như bất khả thi, Anthropic đành phải đình chỉ quyền truy cập của tất cả người dùng vào cả hai mô hình. Mãi đến ngày 30 tháng 6 vừa qua, những kiểm soát này mới được dỡ bỏ. Anthropic đã phát hành Fable 5 và Mythos 5 vào Thứ Ba, ngày 9 tháng 6. Cả hai đều dùng chung một mô hình nền tảng, nhưng Fable 5 được trang bị các cơ chế bảo vệ nghiêm ngặt hơn để an toàn cho mục đích sử dụng chung. Trong khi đó, Mythos 5, với ít lớp bảo vệ hơn, chỉ được cung cấp cho một nhóm nhỏ đối tác đáng tin cậy của Project Glasswing, phục vụ các tác vụ an ninh mạng phòng thủ. Lệnh kiểm soát xuất khẩu ngày 12 tháng 6 được ban hành sau khi chính phủ nhận được báo cáo từ các nhà nghiên cứu Amazon. Báo cáo này chỉ ra rằng họ đã tìm ra cách "vượt rào" các biện pháp an toàn của Fable 5, bằng cách yêu cầu mô hình này xác định nhiều lỗ hổng phần mềm. Đáng chú ý, trong một trường hợp, mô hình thậm chí còn tạo ra mã minh họa cách khai thác lỗ hổng đó. Sau sự việc, Anthropic đã làm việc chặt chẽ với chính phủ và các đối tác, bao gồm Amazon, để xem xét báo cáo và bằng chứng. Kết quả kiểm tra của họ khá thú vị: nhiều mô hình kém mạnh mẽ hơn, như Claude Opus 4.8, GPT-5.5 và Kimi K2.7, cũng có thể xác định các lỗ hổng tương tự Fable 5. Thậm chí, khi nói đến việc tạo ra mã khai thác cho một lỗ hổng cụ thể, mọi mô hình mà Anthropic thử nghiệm – từ Claude Haiku 4.5, Sonnet 4.6, Opus 4.6, Opus 4.7, Opus 4.8 đến GPT-5.4, GPT-5.5 và Kimi K2.7 – đều có thể tạo ra mã tương tự Fable 5. Điều này cho thấy kỹ thuật được báo cáo không phơi bày bất kỳ khả năng tấn