Gia đình GPT-5.6 của OpenAI: cuộc chiến hiệu năng và chi phí

Tôi thấy OpenAI vừa chính thức phát hành dòng mô hình chủ lực mới của họ, GPT-5.6, với ba kích thước khác nhau: Luna (nhỏ nhất), Terra (trung bình) và Sol (lớn nhất). Đây là một động thái đáng chú ý trên thị trường, đặc biệt khi các mô hình này được công bố với cửa sổ ngữ cảnh lên tới một triệu token, khả năng tạo ra 128.000 token đầu ra tối đa, và dữ liệu được cắt tới ngày 16 tháng 2 năm 2026. Về chi phí, các mô hình này được định giá trên mỗi triệu token đầu vào/đầu ra như sau: Luna là 1 USD/6 USD, Terra là 2,50 USD/15 USD và Sol là 5 USD/30 USD. So với dòng Claude Opus (5 USD/25 USD) và Claude Fable 5 (10 USD/50 USD), các con số này chỉ là một phần của câu chuyện, bởi giá trên mỗi triệu token giờ đây không còn phản ánh đầy đủ hiệu năng khi lượng token dùng cho quá trình suy luận có thể rất khác nhau giữa các mô hình cho cùng một tác vụ. OpenAI đặc biệt nhấn mạnh về hiệu suất tác tử dài hạn, một điểm họ tin rằng GPT-5.6 vượt trội. Trên bài kiểm tra "Agents’ Last Exam", một thước đo các quy trình làm việc chuyên nghiệp kéo dài qua 55 lĩnh vực, GPT-5.6 Sol đạt 53.6 điểm, vượt qua Claude Fable 5 (suy luận thích ứng) tới 13.1 điểm. Ngay cả khi ở mức suy luận trung bình, Sol vẫn đánh bại Fable 5 tới 11.4 điểm với chi phí ước tính chỉ bằng khoảng một phần tư. Sự hiệu quả này cũng mở rộng đến các mô hình nhỏ hơn, khi GPT-5.6 Terra và Luna vượt trội hơn Fable 5 với chi phí chỉ bằng khoảng một phần mười sáu, góp phần làm cho trí tuệ nhân tạo trở nên phổ biến và phải chăng hơn. Tuy nhiên, một điểm đáng chú ý là trên bài kiểm tra SWE-Bench Pro, Fable 5 lại đạt tới 80%, trong khi GPT-5.6 Sol chỉ đạt 64.6%. Điều này có thể giải thích lý do tại sao OpenAI đã nhanh chóng công bố một bài viết ngay trước đó, chỉ ra các vấn đề họ tìm thấy khi kiểm toán SWE-Bench Pro, ước tính rằng khoảng 30% các tác vụ của bài kiểm tra này có lỗi. Một số cải tiến đáng giá khác nằm ở các tính năng API mới. "Programmatic Tool Calling" cho phép mô hình tự động biên soạn và chạy JavaScript để điều phối