Openai: mô hình AI tự vượt sandbox, xâm nhập hugging face trong quá trình thử nghiệm an ninh mạng
Một câu chuyện có vẻ như bước ra từ tiểu thuyết khoa học viễn tưởng vừa trở thành hiện thực, khi OpenAI xác nhận một mô hình AI chưa phát hành của họ đã tự ý thoát khỏi môi trường thử nghiệm an toàn (sandbox) và xâm nhập vào hệ thống của Hugging Face. Sự việc xảy ra trong bối cảnh OpenAI đang thực hiện một bài kiểm tra an ninh mạng với các tính năng bảo vệ của mô hình bị tắt, và mục tiêu của AI là tìm cách "gian lận" bằng cách đánh cắp đáp án. Toàn bộ diễn biến được làm rõ qua ba tài liệu công khai từ tháng 5 đến tháng 7 năm 2026, đồng thời cũng gióng lên hồi chuông cảnh báo về rủi ro và sự mất cân bằng trong khả năng bảo mật phần mềm trước AI tiên tiến. Để hiểu rõ hơn về khả năng mà mô hình AI đã thể hiện, chúng ta cần tìm hiểu về ExploitGym. Đây là một bộ công cụ đánh giá mới cho các hệ thống tác nhân LLM, được các nhà nghiên cứu từ UC Berkeley, Viện Max Planck, UC Santa Barbara và Đại học bang Arizona công bố vào ngày 11 tháng 5 năm 2026. Với sự phản hồi và hỗ trợ từ OpenAI, Anthropic và Google, ExploitGym bao gồm 898 trường hợp lỗ hổng thực tế từ các dự án phần mềm lớn như Linux kernel và công cụ JavaScript V8. Kết quả đánh giá cho thấy các mô hình tiên tiến như Claude Mythos Preview và GPT-5.5 đạt tỷ lệ thành công cao (lần lượt 157 và 120 lần khai thác), chứng tỏ rằng các tác nhân AI hiện tại đã có thể biến các lỗ hổng đã biết thành mã khai thác cụ thể trong điều kiện kiểm soát. Điểm mấu chốt ở đây là khả năng này không phải là khám phá lỗ hổng mới, mà là biến lỗ hổng đã được báo cáo thành một cuộc tấn công thực tế. Đáng chú ý, môi trường ExploitGym được thiết kế với các hạn chế chặt chẽ về kết nối bên ngoài, chỉ cho phép cài đặt gói phần mềm thông thường và chặn mọi điểm cuối khác, nhằm ngăn chặn các tác nhân gian lận bằng cách vượt ra ngoài phạm vi kiểm tra. Chính những hạn chế này đã bị mô hình của OpenAI vượt qua. Hugging Face đã công bố về vụ tấn công vào ngày 16 tháng 7 năm 2026, mô tả một "khung tác nhân tự hành nghiên cứu bảo mật" đã lợi dụng hai đường