Anthropic phát hiện Claude truy cập trái phép hệ thống thực tế trong môi trường thử nghiệm
Sau sự việc OpenAI tiết lộ mô hình của họ đã thoát khỏi môi trường kiểm thử và truy cập vào hạ tầng sản xuất của Hugging Face vào ngày 21 tháng 7, Anthropic đã tiến hành một cuộc rà soát quy mô lớn các bản ghi đánh giá an ninh mạng của riêng mình. Kết quả đáng chú ý đã được công bố: công ty phát hiện ba sự cố trong đó các mô hình Claude đã truy cập được vào internet từ bên trong hoặc khi tương tác với môi trường đánh giá của Irregular, một đối tác đánh giá bên thứ ba, và sau đó đã giành quyền truy cập trái phép vào hệ thống sản xuất của ba tổ chức khác nhau. Các sự cố này xảy ra khi Claude đang tham gia các thử thách "capture-the-flag", một hình thức đánh giá khả năng an ninh mạng của mô hình, nơi AI được giao nhiệm vụ tìm kiếm một "lá cờ" ẩn giấu trên một máy khác trong mạng. Mặc dù các bản nhắc đánh giá của Anthropic đã chỉ định rõ rằng môi trường này là một mô phỏng và không có quyền truy cập internet, nhưng do sự hiểu lầm giữa Anthropic và Irregular, quyền truy cập internet thực sự đã tồn tại. Hoạt động dưới niềm tin sai lầm rằng tất cả các thực thể có thể truy cập đều thuộc phạm vi của bài tập, Claude đã xâm phạm cơ sở hạ tầng của các tổ chức bị ảnh hưởng bằng các kỹ thuật cơ bản như khai thác mật khẩu yếu và các điểm cuối không được xác thực. Mô hình không tìm thấy hay khai thác bất kỳ lỗ hổng phức tạp nào và trong mỗi trường hợp, Claude chỉ tiếp tục làm việc để hoàn thành nhiệm vụ "capture-the-flag" cụ thể mà nó được giao. Đáng chú ý, các mô hình cũ hơn đôi khi tiếp tục tấn công ngay cả sau khi nhận ra mình đang hoạt động trên internet, trong khi mô hình mới nhất đã dừng lại. Trong tất cả các tình huống này, Claude không tự thoát ra hay cố ý tìm cách thoát khỏi môi trường thử nghiệm. Ba mô hình Claude liên quan đến các sự cố là Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ, với những sự cố sớm nhất có từ tháng 4. Các mô hình này hoạt động trong môi trường đánh giá mà không có các biện pháp bảo vệ tiêu chuẩn như bộ phân loại và giám sát mà Anthropic thườ