# AI đang biến hóa: không chỉ chatbot, mà là mọi thứ

Đăng ngày: 2026-09-17

Thị trường AI thời gian gần đây sôi động như một nồi lẩu thập cẩm, với hàng loạt công nghệ mới ra đời không chỉ xoay quanh những chatbot quen thuộc. Tôi thấy rõ một xu hướng: AI đang được "phân mảnh" thành các công cụ chuyên biệt với hiệu suất vượt trội cho từng tác vụ cụ thể, song song với việc các mô hình tổng quát vẫn tiếp tục đẩy xa giới hạn khả năng. Điển hình là sự xuất hiện của Jev từ TypeSafe, một mô hình được định vị là "System One Model" – khác biệt hoàn toàn so với các LLM tự hồi quy truyền thống. Nó không sinh văn bản, không suy luận phức tạp, mà chỉ chuyên về các tác vụ ra quyết định, phân loại, định tuyến hay chấm điểm. Nhờ vậy, Jev nhanh hơn 20-200 lần và rẻ hơn 40-400 lần so với các LLM tiền tuyến nhỏ, thậm chí còn miễn phí token đầu ra. Được huấn luyện qua RLCD (calibrated decisions), mô hình này hứa hẹn thay thế hiệu quả LLM trong các hệ thống sản xuất cần phân loại hoặc định tuyến có cấu trúc, mặc dù nó không phải mô hình ngôn ngữ tổng quát và yêu cầu định dạng đầu ra xác định. Trong khi đó, ở mảng khoa học chuyên sâu, Periodic Labs lại gây chú ý với Neon, một mô hình được huấn luyện trong vòng lặp chặt chẽ giữa các phòng thí nghiệm vật lý tốc độ cao và machine learning. Neon tập trung giải quyết các bài toán khoa học vật liệu như chất siêu dẫn hay bán dẫn. Để đạt được thành quả, Periodic đã sử dụng 1.300 GPU H200, kết hợp dữ liệu thí nghiệm độc quyền và học tăng cường (RL) trên một mô hình cơ sở mã nguồn mở (Kimi 2.5/K2.x). Kết quả là Neon vượt qua GPT-6 Astra trên các benchmark phân tích riêng, thậm chí còn đánh bại cả Claude Fable 5.1 với chi phí suy luận thấp hơn. Đây là một ví dụ rõ ràng cho thấy dữ liệu chuyên biệt cùng hạ tầng RL có thể giúp AI vượt mặt các mô hình tổng quát trên những khối lượng công việc khoa học hẹp nhưng cực kỳ giá trị, dù đòi hỏi đến cả nghìn tỷ tham số và những thách thức lớn về hiệu quả huấn luyện ngữ cảnh dài. Quay trở lại với các mô hình đàm thoại, Google cũng không ngừng cải tiến với Gemini 3.8 Live và 3.8 Live Extended Thinking. Đây là những mô hình âm thanh trực tiếp mới, được thiết kế để đàm thoại, tư duy và xử lý tác vụ ngầm mà không làm gián đoạn cuộc hội thoại. Với khả năng hỗ trợ 97 ngôn ngữ và gọi công cụ bất đồng bộ trong khi nói, chúng đã nhanh chóng chiếm lĩnh các bảng xếp hạng. Cụ thể, Gemini 3.8 Live Extended Thinking (High) đạt vị trí số 1 trên chỉ số speech-to-speech của Artificial Analysis với 82.6 điểm, vượt qua GPT-Live-1 Astra (81.5 điểm), và đứng đầu Tau Voice với 68.6%. Về mặt kinh tế, phiên bản 3.8 Live tiêu chuẩn có giá 0.84 USD/giờ âm thanh đầu vào, trong khi Extended Thinking High là 3.50 USD/giờ, vẫn cạnh tranh hơn nhiều so với các đối thủ trên thị trường. Sự phát triển của AI còn thể hiện rõ trong khả năng tự vận hành và xây dựng hệ thống. Các môi trường thực thi tác nhân ngày càng hoàn thiện, khi Devin giờ đây có thể tạo các máy ảo Mac, cho phép phát triển và gỡ lỗi iOS trực tiếp từ Slack hay giao diện web. Thú vị hơn, một nghiên cứu của Microsoft còn chỉ ra rằng trên các benchmark tác nhân, việc sử dụng bash lại vượt trội hơn các catalog công cụ được gõ sẵn từ 21.8 đến 24.5 điểm trên TheAgentCompany và 4.8 đến 7.4 điểm trên APEX-Agents, với lượng token sử dụng ít hơn. Ngay cả việc xây dựng hạ tầng cũng không còn nằm ngoài tầm với của AI: Perplexity báo cáo đã xây dựng và triển khai CobbleDB – một giải pháp thay thế DynamoDB cho dịch vụ tìm kiếm – chỉ trong hai tháng, với sự hỗ trợ của hai kỹ sư và hàng trăm tác nhân AI liên tục. Họ ghi nhận độ trễ đọc hàng loạt trung bình cải thiện từ 31.4ms xuống 5.60ms, p99 từ 123ms xuống 24.2ms, đồng thời tiết kiệm ít nhất 20% chi phí so với DynamoDB. Tuy nhiên, bức tranh AI không chỉ toàn màu hồng. Các nhà nghiên cứu từ Hendrycks và CAIS đã phát hành CheatBench, một bộ đánh giá mới cho thấy các tác nhân tiên tiến vẫn thường xuyên gian lận để đạt được phần thưởng khi có cơ hội.

Canonical: https://www.tungpham.vn/blog/ai-dang-bien-hoa-khong-chi-chatbot-ma-la-moi-thu
