# Hồi sinh megakernels và cuộc đua mô hình AI đỉnh cao

Đăng ngày: 2026-08-10

Những cuộc tranh luận nảy lửa về Megakernels dường như không bao giờ dứt trong giới kỹ sư AI. Một mặt, nhiều chuyên gia cho rằng kỷ nguyên Megakernels đã chấm dứt bởi sự phức tạp trong việc tối ưu hóa và hiệu quả vượt trội của các giải pháp thay thế. Mặt khác, những đột phá mới lại khiến chúng ta phải nhìn nhận lại. Tôi nhận thấy, đây không chỉ là một cuộc đấu giữa các phương pháp kỹ thuật mà còn phản ánh xu hướng không ngừng tìm kiếm hiệu suất trong ngành AI. Trước đây, lập luận Megakernels đã "chết" khá vững chắc. Việc bỏ ra đến hai tháng để viết một kernel nhằm giảm chi phí khởi tạo và tăng cường sự chồng chéo giữa các kernel dường như không còn hiệu quả. Ali từ Waterloo_Intern đã bày tỏ quan điểm thẳng thắn rằng megakernels rất khó tối ưu hóa. Ngay cả với tensor parallelism, các phép toán phi tuyến tính như softmax yêu cầu giao tiếp liên tục giữa các GPU để tổng hợp kết quả từng phần, một vấn đề mà fused kernel cũng không thể giải quyết triệt để. Hơn nữa, những cái tên như TensorRT-LLM và các kernel module hóa đã chứng minh hiệu quả hơn trong việc tối ưu từng thành phần riêng lẻ và cho phép chúng chạy song song. Điểm đáng chú ý nhất có lẽ là từ một tech lead của NVIDIA, người đã tiết lộ rằng GPU Rubin mới được thiết kế theo cách "khai tử" megakernels, ngụ ý rằng hướng nghiên cứu này sẽ không còn được tiếp tục. Tuy nhiên, thực tế cho thấy Megakernels đang có dấu hiệu "hồi sinh" mạnh mẽ. Stuart Sul, đồng tác giả của một nghiên cứu nổi tiếng về megakernels, hiện đang dẫn dắt nhóm Cursor và đã cho ra mắt megakernel mã nguồn mở "Mixture of Kittens" với kết quả hết sức ấn tượng: tăng 41% số tokens mỗi giây. Ở quy mô lớn, con số này có thể dịch ra hàng tỷ đô la tiết kiệm. Đây là một minh chứng không thể phủ nhận về tiềm năng của megakernels khi được triển khai đúng cách. Hơn nữa, NVIDIA Rubin, dù ban đầu được cho là đối thủ, lại có tính năng "dependency triggers" giúp giải quyết một phần tắc nghẽn trong pipeline — một trong những lý do chính trước đây cần đến kernel fusion. Điều này cho thấy sự phát triển của phần cứng và phần mềm đang cùng nhau mở ra những khả năng mới. Song song với cuộc cách mạng tối ưu hóa ở tầng sâu, ngành AI cũng chứng kiến sự ra mắt liên tục của các mô hình tiên tiến. Alibaba tiếp tục thể hiện tốc độ phát triển chóng mặt với Qwen 3.8-Max, được quảng bá là "tốt hơn và rẻ hơn," và nhanh chóng tích hợp vào các hệ sinh thái agent như Hermes Agent, Nous Research và ClinePass. Về khả năng thị giác, Qwen 3.8-Max đạt 60% mAP với một hộp và 80% với nhiều hộp cho các khái niệm khó mô tả, trong khi Qwen-Image-3.0-Pro vươn lên vị trí thứ 5 trong Text-to-Image Arena. NVIDIA cũng không đứng ngoài cuộc với Alpamayo 2 Super, một mô hình dành cho lập luận trong xe tự lái với điều khoản phát hành mã nguồn mở cho mục đích thương mại. MistralAI, một cái tên nổi bật khác, ra mắt Shieldstral, một mô hình an toàn 3 tỷ tham số mã nguồn mở, chuyên về kiểm duyệt và phân loại trên thiết bị. Tổng thể lại, tôi nhận thấy bức tranh AI đang ngày càng phức tạp và đa chiều. Một mặt, chúng ta chứng kiến cuộc chiến không ngừng nghỉ để vắt kiệt hiệu suất từ phần cứng thông qua những tối ưu hóa cấp thấp như megakernels. Mặt khác, làn sóng mô hình mới vẫn liên tục đổ bộ, mang đến những khả năng chuyên biệt và mạnh mẽ hơn cho nhiều lĩnh vực khác nhau. Điều này đặt ra câu hỏi về sự cân bằng giữa việc tinh chỉnh từng chi tiết nhỏ và việc mở rộng quy mô, năng lực tổng thể của AI. Có lẽ, trong bối cảnh này, những giải pháp lai ghép và khả năng thích ứng linh hoạt mới là chìa khóa cho sự phát triển trong tương lai.

Canonical: https://www.tungpham.vn/blog/hoi-sinh-megakernels-va-cuoc-dua-mo-hinh-ai-dinh-cao
