# Các mô hình trí tuệ nhân tạo mới và cuộc đua tốc độ xử lý dữ liệu

Đăng ngày: 2026-10-03

Thị trường công nghệ vừa chứng kiến một loạt ra mắt đáng chú ý từ các phòng thí nghiệm lớn, tâm điểm là sự xuất hiện của mô hình Gemini 4 Argon cùng các giải pháp phần cứng và nhúng mới. Cuộc cạnh tranh không chỉ xoay quanh khả năng xử lý mã nguồn và tác vụ tự động hóa, mà còn mở rộng sang dung lượng đầu ra và tối ưu chi phí vận hành cho doanh nghiệp. SỰ XUẤT HIỆN CỦA GEMINI 4 ARGON VÀ CÁC THÔNG SỐ HIỆU SUẤT Google DeepMind vừa giới thiệu Gemini 4 Argon hướng đến các tác vụ lập trình, tri thức doanh nghiệp và an ninh mạng. Mô hình này hiện được cung cấp trước cho người dùng chính phủ và chuyên gia an ninh mạng trong Chương trình Fairwind trước khi mở rộng cho nhà phát triển và doanh nghiệp. Điểm nhấn kỹ thuật là giới hạn đầu ra đạt một triệu token, tăng mạnh từ mức 64 nghìn token nhờ tính năng Long Decode Continuation cho phép tạm dừng và tiếp tục phản hồi dài qua các lần gọi API. Về mức giá, Argon có giá tiêu chuẩn là 4 đô la cho mỗi triệu token đầu vào và 20 đô la cho token đầu ra, kèm mức giảm giá giới thiệu 50 phần trăm xuống còn 2 đô la và 10 đô la, cùng mức giảm 95 phần trăm cho đầu vào đã lưu vào bộ nhớ đệm. Trong các bài kiểm tra do hãng công bố, Argon dẫn đầu ở 13 trên 19 tiêu chuẩn so với các đối thủ như GPT-6 Astra và Claude Opus 5.5. Cụ thể, mô hình đạt 77.9 phần trăm trên DeepSWE, vượt qua mức 74.2 phần trăm của Opus 5.5. Nội bộ Google ghi nhận các tác vụ tự động hóa của Argon đã giải phóng hơn 300 TiB bộ nhớ trung tâm dữ liệu và đang di dời hơn 800 nghìn dòng mã nguồn nhân kernel C và C++ sang ngôn ngữ Rust. CÁC CẬP NHẬT TỪ OPENAI VÀ HỆ SINH THÁI MÔ HÌNH NHỎ OpenAI đã khắc phục lỗi mã hóa hình ảnh trên mô hình GPT-6 Luna, giúp tăng một điểm trong Chỉ số Thông minh. Hãng này cũng ghi nhận tốc độ suy luận đạt tới 300 token mỗi giây khi chạy trên phần cứng đồ họa chuyên dụng ở các lô xử lý nhỏ. Sự kiện DevDay của hãng ra mắt các tính năng như các tác vụ tự động bền vững đi kèm đám mây riêng và giao diện lập trình ứng dụng quyết định. Ở mảng mô hình nguồn mở và nhúng, Perplexity phát hành mô hình mã hóa ngữ cảnh pplx-embed-v2-context-9b-preview trên nền tảng Hugging Face với khả năng mã hóa toàn bộ tài liệu một lần. Cohere công bố dòng Embed 5 với hai biến thể chuyên sâu và tốc độ. Trong khi đó, Ideogram giới thiệu phiên bản chỉnh sửa ảnh 4.5 duy trì độ trùng khớp từ 94 đến 99 phần trăm nội dung gốc sau mười lần chỉnh sửa liên tiếp. Phía Meta giới thiệu các mô hình ngôn ngữ ngữ cảnh xem bộ nhớ như một tệp có thể chỉnh sửa thay vì nhật ký chỉ nối thêm, giúp tăng 65 phần trăm hiệu suất trên các tác vụ đa kho lưu trữ. Về phần cứng, Cognition trở thành khách hàng đầu tiên sử dụng kiến trúc Vera Rubin qua nhà cung cấp hạ tầng CoreWeave, đạt lưu lượng token gấp khoảng 4.8 lần so với thế hệ trước ở cùng tốc độ giải mã. Nhìn chung, bức tranh công nghệ đang dịch chuyển sang giai đoạn tối ưu hóa khả năng thực thi của các tác nhân tự động và bài toán chi phí vận hành. Khi giới hạn đầu ra được đẩy lên mức một triệu token và các hệ thống phần cứng chuyên dụng dần hoàn thiện, bài toán cốt lõi của doanh nghiệp không chỉ là mô hình nào thông minh hơn, mà là cách tích hợp chúng vào hạ tầng sẵn có một cách hiệu quả và an toàn nhất.

Canonical: https://www.tungpham.vn/blog/cac-mo-hinh-tri-tue-nhan-tao-moi-va-cuoc-dua-toc-do-xu-ly-du-lieu
