AI tư duy được ngay trên thiết bị biên
Trong một thời gian dài, việc đưa các mô hình AI có khả năng suy luận đa bước hay xây dựng tác nhân thông minh (agentic AI) lên các thiết bị biên là một thách thức lớn. Những mô hình như vậy thường quá cồng kềnh để chạy cục bộ, buộc các nhà phát triển phải đẩy quá trình suy luận qua trung tâm dữ liệu. Điều này kéo theo sự phụ thuộc mạng, tăng chi phí vận hành, và tiềm ẩn rủi ro về bảo mật dữ liệu. Nhưng rồi cục diện đã thay đổi. Tôi nhận thấy một bước ngoặt lớn trong AI biên được đánh dấu bằng sự ra đời của nhiều dòng mô hình nguồn mở gọn nhẹ xuyên suốt mùa hè vừa qua. Các mô hình thế hệ mới này mang đến khả năng suy luận và agentic, những thứ mà chỉ vài tháng trước còn đòi hỏi các hệ thống trung tâm dữ liệu khổng lồ. Điều đáng nói là các nền tảng NVIDIA Jetson hiện nay hoàn toàn có thể chạy được chúng. Điều này mở ra cánh cửa cho nhiều ứng dụng thực tiễn như trợ lý thông minh trong cabin, phát hiện bất thường theo thời gian thực, hay robot hoạt động trong môi trường khắc nghiệt và vùng sâu vùng xa. Các chuyên gia tại chỗ sẽ đỡ mất công xử lý sự cố hơn, và các hệ thống trọng yếu có thể duy trì hoạt động ngay cả khi kết nối mạng bị hạn chế hoặc gián đoạn. Sự chuyển dịch này được thúc đẩy bởi các phương pháp huấn luyện tốt hơn và kiến trúc hiệu quả hơn. Ví dụ, Nemotron 3.5 Lightning được tinh chế (distillation) từ Nemotron 3 Ultra, kế thừa khả năng nhưng ở một kích thước nhỏ gọn hơn nhiều. Các kiến trúc khác nhau cũng tạo ra sự đánh đổi giữa khả năng, mức độ sử dụng bộ nhớ và tốc độ tạo phản hồi. Qwen3.8-27B là một mô hình "dense", nghĩa là nó kích hoạt toàn bộ 27 tỷ tham số cho mỗi token, phù hợp cho các tác vụ đòi hỏi ít nhưng khó hơn. Trong khi đó, Nemotron 3.5 Lightning sử dụng kiến trúc hỗn hợp chuyên gia (MoE) với tổng cộng 30 tỷ tham số nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token. Điều này giúp Nemotron 3.5 Lightning phù hợp với các quy trình làm việc nặng về phản hồi, nơi tốc độ tạo token nhanh có thể rút ngắn tổng thể quá trình. Ngoài ra, Gemma 4 E4