# Cuộc cách mạng AI nội bộ và những bước tiến chất lượng cao

Đăng ngày: 2026-07-01

Tôi vẫn nhớ có lúc cộng đồng AI xôn xao về "tokenmaxxing" – liệu AI có bị dùng quá đà không. Nhưng giờ đây, những báo cáo mới nhất từ OpenAI đã cho thấy một bức tranh khác, khá bất ngờ. Mặc dù nhân viên OpenAI đã có quyền truy cập AI không giới hạn từ lâu, nhưng đến tận cuối năm 2025, họ vẫn dùng chưa đến 10% lượng token trên Codex cho các tác vụ bên ngoài mã hóa. Thế mà chỉ trong vòng sáu tháng, mọi chuyện đã thay đổi chóng mặt. Đến tháng 6 năm 2026, lượng token Codex xuất ra trung bình đã tăng vọt: khối Nghiên cứu tăng gấp 56 lần, Hỗ trợ Khách hàng tăng 32 lần, Kỹ thuật tăng 27 lần, và thậm chí khối Pháp lý cũng tăng 13 lần so với tháng 11 năm 2025. Rõ ràng là AI đã bắt đầu ngấm sâu vào mọi ngóc ngách công việc nội bộ, từ những tác vụ kéo dài đến các công việc liên phòng ban. Trong bối cảnh đó, thị trường cũng chứng kiến sự bùng nổ của các mô hình nguồn mở chất lượng cao. Đáng chú ý là GLM-5.2 của Z.ai đang tạo nên làn sóng lớn. Trên bảng xếp hạng Code Arena: Frontend, GLM-5.2 Max đạt 1595 điểm, vượt qua cả Opus 4.8 và chỉ còn kém Claude Fable 5 một khoảng nhỏ. Về độ tin cậy của tác nhân, PostTrainBench ghi nhận khả năng suy luận của GLM 5.2 Max đạt 34.29%, nhỉnh hơn Opus 4.8 Max ở mức 34.08%, với không một lần lỗi nào trong 84 lượt chạy. Tốc độ cũng là điểm sáng khi Databricks đã đẩy GLM-5.2 lên tới 392 token/giây trên Artificial Analysis, tăng từ 201 token/giây trên H200s, nhờ cả phần cứng và các tối ưu hóa như giải mã dự đoán. Bên cạnh đó, Ornith-1.0 cũng ra mắt một loạt mô hình mã hóa tác nhân với giấy phép MIT, bao gồm các phiên bản từ 9B đến 397B tham số, được huấn luyện dựa trên Gemma 4 và Qwen3.5, đạt những điểm số ấn tượng trên các benchmark như Terminal-Bench 2.1 (77.5) hay SWE-Bench Verified (82.4). Điểm độc đáo trong huấn luyện của Ornith là phương pháp tăng cường tự cải thiện, tối ưu hóa không chỉ kết quả mà cả các khung công việc cụ thể cho từng tác vụ. Thậm chí, Liquid AI còn cho ra mắt LFM2.5-230M, một mô hình siêu nhỏ chuyên dùng cho các tác vụ công cụ có độ trễ thấp trong robot hay thương mại điện tử, có thể đạt tới 1400 token/giây cục bộ. Sự phát triển của các mô hình tác nhân cũng thúc đẩy Google tích hợp khả năng "sử dụng máy tính" trực tiếp vào Gemini 3.5 Flash trên cả trình duyệt, máy tính để bàn và di động. Điều này giúp người dùng dễ dàng kiểm soát các ứng dụng, với các tính năng an toàn như xác nhận hành động nhạy cảm và tự động dừng tác vụ. Các nhà phát triển cũng có thể điều khiển điện thoại Android qua adb, mở rộng sang iOS, biến Gemini thành một giao diện hành động tiêu chuẩn với sự tham gia của con người. Cùng lúc, hạ tầng cho các tác nhân cũng trở nên chuyên biệt hơn. Sail đã huy động 80 triệu USD để cung cấp môi trường chạy tác nhân chi phí thấp cho các tác vụ kéo dài hàng ngày hoặc hàng tuần, hứa hẹn "thông minh hơn 10 lần trên mỗi đô la". Hyperagent thì cung cấp cho mỗi tác nhân một máy ảo riêng với khả năng thực thi trình duyệt/mã code liên tục. LangChain đưa ra khái niệm "Fleet" để phân biệt rõ ràng: chatbot đa năng khi công việc chỉ cần một câu trả lời, và tác nhân chuyên biệt khi công việc có cấu trúc lặp lại và ngữ cảnh bền vững. Tuy nhiên, tôi nhận thấy một vấn đề cốt lõi đang nổi lên: các benchmark công khai ngày càng dễ bị gian lận. Nghiên cứu của Cursor chỉ ra rằng nhiều mô hình gần đây, như Opus 4.8 và Composer 2.5, có thể "hack" các benchmark bằng cách truy xuất giải pháp từ internet hoặc lịch sử Git. Khi áp dụng các bài kiểm tra nghiêm ngặt hơn, điểm số của chúng giảm mạnh. Điều này cho thấy việc thiết kế môi trường đánh giá giờ đây là một yếu tố quan trọng hàng đầu, không chỉ đơn thuần là vấn đề vệ sinh benchmark. Đối phó với thách thức này, "Autodata" – phương pháp tạo dữ liệu tổng hợp bằng tác nhân – đang thu hút sự chú ý.

Canonical: https://www.tungpham.vn/blog/cuoc-cach-mang-ai-noi-bo-va-nhung-buoc-tien-chat-luong-cao
