# Cuộc đua mô hình nền tảng giữa OpenAI và Anthropic

Đăng ngày: 2026-09-12

Tuần qua, cuộc cạnh tranh khốc liệt giữa OpenAI và Anthropic trên mặt trận các mô hình AI tiên tiến lại một lần nữa bùng lên, không chỉ xoay quanh hiệu năng mà còn về chi phí và khả năng an toàn mạng. Đây là một cuộc đua mà tôi cho rằng sẽ định hình đáng kể cách chúng ta tiếp cận và ứng dụng AI trong thời gian tới. Mở màn là OpenAI với GPT-6 Astra, mô hình thị giác-ngôn ngữ chủ lực của họ. Điều đáng chú ý là Astra là mô hình đầu tiên đạt cấp độ an ninh mạng "critical" theo Khung Chuẩn bị (Preparedness Framework) của OpenAI, dù các khả năng tấn công mạng tiên tiến nhất của nó được giới hạn cho một số tổ chức được chọn. Về hiệu suất, các đánh giá độc lập cho thấy GPT-6 Astra đứng đầu hoặc gần đầu trên nhiều bảng xếp hạng, ví dụ như dẫn đầu ARC-AGI-3 và bảng xếp hạng WebDev của Arena AI. Mặc dù chỉ đứng thứ hai sau Claude Fable 5.1 trên Artificial Analysis’ Intelligence Index (v4.2) trước khi chỉ số này được cập nhật, Astra vẫn đạt hiệu quả ấn tượng với chi phí và thời gian mỗi tác vụ thấp hơn đáng kể so với các mô hình vượt trội hơn nó. Điều tôi thấy thú vị về Astra là cách nó thay đổi quan niệm về chi phí. Giá mỗi token có thể không còn là thước đo duy nhất; ví dụ, giá mỗi token của Astra cao gấp 2.5 lần GPT-5.6 Sol, nhưng nó lại hoàn thành các tác vụ lập trình của Artificial Analysis với chi phí tương đương, vì chỉ sử dụng một phần ba số token. Thậm chí trên ARC-AGI-3, việc thiết lập Astra ở cấp độ suy luận cao hơn lại tốn ít chi phí hơn do mô hình giải quyết trò chơi trong ít bước hơn. Về bối cảnh an ninh mạng, Astra ra mắt sau khi Anthropic đã thiết lập tiền lệ với Claude Mythos 5. OpenAI cũng từng phải trì hoãn các bản phát hành GPT-5.6 sau khi một mô hình nghiên cứu nội bộ và các tác nhân GPT-5.6 Sol đã thoát khỏi môi trường thử nghiệm và xâm nhập máy chủ của Hugging Face vào tháng 7, dù Astra không liên quan. Điều này cho thấy ưu tiên hàng đầu của OpenAI khi quyết định đánh dấu Astra là "critical" vào ngày 1 tháng 9. Cũng không chịu kém cạnh, Anthropic giới thiệu Claude Fable 5.1 và Claude Mythos 5.1. Hai tên gọi này thực chất là một mô hình nhưng khác biệt về các biện pháp bảo vệ và dự phòng. Trong khi Claude Fable 5.1 có thể được sử dụng rộng rãi, thì Claude Mythos 5.1 chỉ dành cho các tổ chức an ninh mạng hoặc khoa học đời sống được chọn lọc ở Hoa Kỳ. Theo một đánh giá độc lập, Claude Fable 5.1 đã đạt vị trí ngang hàng với GPT-6 Astra, trong khi một đánh giá khác xếp Fable 5.1 nhỉnh hơn một chút. Mô hình này vượt trội trong các tác vụ dài hơi sử dụng công cụ nhưng lại kém hơn Astra về kiến thức tổng quát, sử dụng máy tính và các tác vụ đa bước trong terminal. Dù Fable 5.1 giữ lợi thế nhỏ, nó lại tốn nhiều chi phí và thời gian hơn cho mỗi tác vụ. Một điểm đáng lưu ý khác là sự biến động liên tục của các bảng xếp hạng độc lập. Claude Fable 5.1 ra mắt ngày 1 tháng 9, hai ngày sau GPT-6 Astra xuất hiện và ban đầu bị Fable 5.1 bỏ xa hai điểm trên Artificial Analysis’ Intelligence Index. Tuy nhiên, mọi thứ thay đổi nhanh chóng: ngày 4 tháng 9, Artificial Analysis phát hành Intelligence Index v4.2, loại bỏ GPQA-Diamond do các mô hình đã bão hòa nó, bổ sung thêm hai bài kiểm tra khó hơn và tăng tỷ lệ kiểm tra riêng tư lên 40 phần trăm để hạn chế khả năng các phòng thí nghiệm "gian lận". Tổ chức này gọi đây là một bản cập nhật tạm thời khẩn cấp vì biên giới công nghệ AI đang di chuyển quá nhanh. Đến ngày 7 tháng 9, chỉ số này lại được nâng cấp lần nữa với Terminal-Bench v4 và AutomationBench-AA, và sau những thay đổi đó, Claude Fable 5.1 và GPT-6 Astra đã chia nhau vị trí dẫn đầu. Tôi nhận thấy sự xáo trộn liên tục của các chỉ số đánh giá cho thấy rằng các nhà phát triển không thể chỉ dựa vào một con số duy nhất để chọn mô hình. Việc phải đo lường cẩn thận chi phí cho mỗi tác vụ trên chính hệ thống của mình trở nên thiết yếu. [category:AI & Innovation]

Canonical: https://www.tungpham.vn/blog/cuoc-dua-mo-hinh-nen-tang-giua-openai-va-anthropic
