# AI tư duy được ngay trên thiết bị biên

Đăng ngày: 2026-09-07

Trong một thời gian dài, việc đưa các mô hình AI có khả năng suy luận đa bước hay xây dựng tác nhân thông minh (agentic AI) lên các thiết bị biên là một thách thức lớn. Những mô hình như vậy thường quá cồng kềnh để chạy cục bộ, buộc các nhà phát triển phải đẩy quá trình suy luận qua trung tâm dữ liệu. Điều này kéo theo sự phụ thuộc mạng, tăng chi phí vận hành, và tiềm ẩn rủi ro về bảo mật dữ liệu. Nhưng rồi cục diện đã thay đổi. Tôi nhận thấy một bước ngoặt lớn trong AI biên được đánh dấu bằng sự ra đời của nhiều dòng mô hình nguồn mở gọn nhẹ xuyên suốt mùa hè vừa qua. Các mô hình thế hệ mới này mang đến khả năng suy luận và agentic, những thứ mà chỉ vài tháng trước còn đòi hỏi các hệ thống trung tâm dữ liệu khổng lồ. Điều đáng nói là các nền tảng NVIDIA Jetson hiện nay hoàn toàn có thể chạy được chúng. Điều này mở ra cánh cửa cho nhiều ứng dụng thực tiễn như trợ lý thông minh trong cabin, phát hiện bất thường theo thời gian thực, hay robot hoạt động trong môi trường khắc nghiệt và vùng sâu vùng xa. Các chuyên gia tại chỗ sẽ đỡ mất công xử lý sự cố hơn, và các hệ thống trọng yếu có thể duy trì hoạt động ngay cả khi kết nối mạng bị hạn chế hoặc gián đoạn. Sự chuyển dịch này được thúc đẩy bởi các phương pháp huấn luyện tốt hơn và kiến trúc hiệu quả hơn. Ví dụ, Nemotron 3.5 Lightning được tinh chế (distillation) từ Nemotron 3 Ultra, kế thừa khả năng nhưng ở một kích thước nhỏ gọn hơn nhiều. Các kiến trúc khác nhau cũng tạo ra sự đánh đổi giữa khả năng, mức độ sử dụng bộ nhớ và tốc độ tạo phản hồi. Qwen3.8-27B là một mô hình "dense", nghĩa là nó kích hoạt toàn bộ 27 tỷ tham số cho mỗi token, phù hợp cho các tác vụ đòi hỏi ít nhưng khó hơn. Trong khi đó, Nemotron 3.5 Lightning sử dụng kiến trúc hỗn hợp chuyên gia (MoE) với tổng cộng 30 tỷ tham số nhưng chỉ kích hoạt khoảng 3 tỷ tham số cho mỗi token. Điều này giúp Nemotron 3.5 Lightning phù hợp với các quy trình làm việc nặng về phản hồi, nơi tốc độ tạo token nhanh có thể rút ngắn tổng thể quá trình. Ngoài ra, Gemma 4 E4B cũng là một lựa chọn khởi điểm tốt cho Jetson Orin Nano. Để đạt được hiệu suất tối ưu trên Jetson, có hai kỹ thuật bổ trợ đặc biệt quan trọng: lượng tử hóa NVFP4 và giải mã suy đoán (speculative decoding). Lượng tử hóa NVFP4 giúp giảm công việc và bộ nhớ cần thiết cho các phép toán của mô hình, cải thiện tốc độ tạo phản hồi và giảm sử dụng bộ nhớ mà vẫn giữ được chất lượng gần với định dạng BF16. Trong khi đó, giải mã suy đoán sử dụng một mô hình nháp nhỏ hơn để đề xuất nhiều token cùng lúc, sau đó mô hình chính sẽ xác minh chúng. Nếu mô hình chính chấp nhận một vài token được đề xuất, quá trình tạo phản hồi sẽ tiến lên nhiều token trong một bước xác minh duy nhất, tăng tốc đáng kể. Các phương pháp tạo nháp như MTP, DFlash và DSpark đều có thể chạy trên Jetson, với Nemotron 3.5 Lightning hoạt động tốt nhất với DSpark, và Qwen3.8-27B thì tốt nhất với DFlash2. Những tối ưu này mang lại hiệu suất ấn tượng. Tôi thấy rằng Nemotron 3.5 Lightning kết hợp DSpark có thể đạt từ 123.01 đến 138.02 token đầu ra mỗi giây, trong khi Qwen3.8-27B với DFlash2 đạt từ 27.69 đến 34.44 token đầu ra mỗi giây, tùy thuộc vào loại tác vụ như viết, suy luận, tóm tắt hay tạo phản hồi có bổ trợ truy xuất (RAG). Điều này cho thấy tầm quan trọng của việc kiểm thử cấu hình với các dữ liệu thực tế của ứng dụng. Hầu hết các ứng dụng có thể bắt đầu với các checkpoint lượng tử hóa và mô hình nháp có sẵn mà không cần huấn luyện tùy chỉnh. Tuy nhiên, nếu cần độ chính xác cao hoặc tối ưu hơn, NVIDIA Model Optimizer cung cấp các tùy chọn tinh chỉnh mô hình lượng tử hóa, và vLLM Speculators có thể giúp huấn luyện bộ suy đoán tương thích. Các vòng lặp agent này có thể chạy ngay cạnh các cảm biến và hệ thống mà chúng làm việc, thông qua các framework phổ biến như vLLM và llama.cpp, giảm tối đa sự phụ thuộc vào trung tâm dữ liệu.

Canonical: https://www.tungpham.vn/blog/ai-tu-duy-duoc-ngay-tren-thiet-bi-bien
