Tự động hóa AI đang vượt khả năng của chúng ta

Tôi nhận thấy một dấu hiệu đáng chú ý về khả năng tự cải thiện của AI đến từ Fable, một hệ thống AI vừa tạo ra "megakernel" đầu tiên và nhanh nhất từng được gửi lên KernelBench-Mega. Đây là một bước đột phá quan trọng vì nó liên quan đến việc thiết kế kernel, một trong những nhiệm vụ nền tảng trong nghiên cứu và phát triển AI. Cụ thể, Fable đã đạt được tốc độ nhanh hơn tới 18.71 lần khi viết mã CUDA trên RTX PRO 6000 Blackwell so với một baseline PyTorch đã được tối ưu. Để dễ hình dung, các nỗ lực khác của Claude Opus 4.8 chỉ đạt 14.4 lần, GLM-5.2 là 11.14 lần và GPT 5.5 là 4.34 lần, tất cả đều dùng Triton. Điều đáng nể là trong khi các đối thủ phân tách vấn đề thành 4 đến 14 lần khởi chạy kernel cho mỗi token, Fable chỉ cần chính xác MỘT lần. Khả năng tự động phát triển và cải thiện các kernel này là một tín hiệu rõ ràng cho thấy AI đang trở nên hiệu quả hơn trong việc xây dựng chính bản thân chúng, mở ra cánh cửa cho cái gọi là "tự cải thiện đệ quy". Không chỉ dừng lại ở cốt lõi R&D, các hệ thống AI còn đang thể hiện sự tiến bộ vượt bậc trong các công việc trực tuyến có giá trị kinh tế. Nghiên cứu từ Trung tâm An toàn AI (CAIS) và Scale Labs trên chỉ số Remote Labor Index (RLI) cho thấy tỉ lệ thành công của AI trong các dự án freelance online đã tăng đáng kể, từ 2.5% khi ra mắt vào tháng 10 năm 2025 lên 16.1% vào tháng 7 năm 2026. Chỉ trong vòng chưa đầy tám tháng, năng lực của các mô hình tiên tiến đã tăng hơn bốn lần. Cụ thể, Fable 5 đạt 16.1%, Opus 4.8 đạt 8.3% và GPT-5.5 là 6.3% trong các bài kiểm tra thực tế như thiết kế nhẫn (thay đổi kiểu cắt đá, tạo mô hình 3D và render), sản xuất video quảng cáo hoạt hình 2D dài 60 giây theo kịch bản, hay tạo bản vẽ mặt bằng và render phòng tắm từ ảnh và kích thước đo đạc. Đây đều là những công việc đòi hỏi sự tỉ mỉ và khả năng giải quyết vấn đề end-to-end. Cùng lúc đó, OSWORLD 2.0, một benchmark mới từ liên minh các nhà nghiên cứu hàng đầu, đang cho thấy AI có thể thực hiện các tác vụ máy tính đa bước, đa chương trìn