# Gia đình GPT-5.6 của OpenAI: cuộc chiến hiệu năng và chi phí

Đăng ngày: 2026-07-10

Tôi thấy OpenAI vừa chính thức phát hành dòng mô hình chủ lực mới của họ, GPT-5.6, với ba kích thước khác nhau: Luna (nhỏ nhất), Terra (trung bình) và Sol (lớn nhất). Đây là một động thái đáng chú ý trên thị trường, đặc biệt khi các mô hình này được công bố với cửa sổ ngữ cảnh lên tới một triệu token, khả năng tạo ra 128.000 token đầu ra tối đa, và dữ liệu được cắt tới ngày 16 tháng 2 năm 2026. Về chi phí, các mô hình này được định giá trên mỗi triệu token đầu vào/đầu ra như sau: Luna là 1 USD/6 USD, Terra là 2,50 USD/15 USD và Sol là 5 USD/30 USD. So với dòng Claude Opus (5 USD/25 USD) và Claude Fable 5 (10 USD/50 USD), các con số này chỉ là một phần của câu chuyện, bởi giá trên mỗi triệu token giờ đây không còn phản ánh đầy đủ hiệu năng khi lượng token dùng cho quá trình suy luận có thể rất khác nhau giữa các mô hình cho cùng một tác vụ. OpenAI đặc biệt nhấn mạnh về hiệu suất tác tử dài hạn, một điểm họ tin rằng GPT-5.6 vượt trội. Trên bài kiểm tra "Agents’ Last Exam", một thước đo các quy trình làm việc chuyên nghiệp kéo dài qua 55 lĩnh vực, GPT-5.6 Sol đạt 53.6 điểm, vượt qua Claude Fable 5 (suy luận thích ứng) tới 13.1 điểm. Ngay cả khi ở mức suy luận trung bình, Sol vẫn đánh bại Fable 5 tới 11.4 điểm với chi phí ước tính chỉ bằng khoảng một phần tư. Sự hiệu quả này cũng mở rộng đến các mô hình nhỏ hơn, khi GPT-5.6 Terra và Luna vượt trội hơn Fable 5 với chi phí chỉ bằng khoảng một phần mười sáu, góp phần làm cho trí tuệ nhân tạo trở nên phổ biến và phải chăng hơn. Tuy nhiên, một điểm đáng chú ý là trên bài kiểm tra SWE-Bench Pro, Fable 5 lại đạt tới 80%, trong khi GPT-5.6 Sol chỉ đạt 64.6%. Điều này có thể giải thích lý do tại sao OpenAI đã nhanh chóng công bố một bài viết ngay trước đó, chỉ ra các vấn đề họ tìm thấy khi kiểm toán SWE-Bench Pro, ước tính rằng khoảng 30% các tác vụ của bài kiểm tra này có lỗi. Một số cải tiến đáng giá khác nằm ở các tính năng API mới. "Programmatic Tool Calling" cho phép mô hình tự động biên soạn và chạy JavaScript để điều phối các lệnh gọi công cụ, giúp thu hẹp khoảng cách giữa các công cụ hiện có và một phiên làm việc đầy đủ như trên terminal. Tính năng "Multi-agent" cho phép mô hình tự tạo ra các tác tử phụ để thực hiện công việc song song, tập trung, tích hợp mô hình làm việc đa tác tử ngay vào lõi API. Ngoài ra, việc bổ sung "Prompt cache breakpoints" tương tự như cơ chế của Claude, cho phép người dùng chủ động chỉ định các điểm ngắt bộ đệm lệnh gợi ý, thay vì phụ thuộc hoàn toàn vào phát hiện tự động của API. Cá nhân tôi vẫn thích phát hiện tự động hơn, nhưng có lẽ tính năng này mang lại lợi ích tối ưu hóa chi phí cho những ai muốn tự quản lý. Cuối cùng, yêu cầu hình ảnh giờ đây có thể đặt detail: original để tránh việc thay đổi kích thước ảnh trước khi xử lý. Tôi có dịp được trải nghiệm sớm GPT-5.6 Sol, và phải thừa nhận mô hình này rất năng lực. Tuy nhiên, với các tác vụ viết mã phức tạp mà tôi thường dùng với mô hình của Anthropic, Sol chưa thực sự khiến tôi thấy nó vượt trội hơn Fable. Điều này cho thấy cuộc đua giữa các ông lớn vẫn còn rất gay cấn, không chỉ ở hiệu suất thô mà còn ở khả năng ứng dụng thực tế và chi phí vận hành. Các ví dụ chi phí cụ thể như việc xử lý 18 hình ảnh chim bồ nông với mức độ suy luận khác nhau, từ 0.71 cent cho Luna ở mức không suy luận đến 48.55 cent cho Sol ở mức suy luận tối đa, cho thấy tiềm năng to lớn trong việc tối ưu hóa. Và có lẽ, việc OpenAI dùng demo những chú chim bồ nông 3D cưỡi xe đạp, xe ba bánh trong livestream ra mắt cũng là một cách hóm hỉnh để họ minh họa cho khả năng đa phương thức đang ngày càng tiến bộ của AI. Rõ ràng, AI đang dần trở thành một hạ tầng cốt lõi, và những cải tiến về hiệu quả chi phí cùng khả năng vận hành tác tử sẽ quyết định ai là người chiến thắng trong cuộc chiến giành giật thị trường.

Canonical: https://www.tungpham.vn/blog/gia-dinh-gpt-56-cua-openai-cuoc-chien-hieu-nang-va-chi-phi
