# AI chinh phục lập trình tuần lễ và tăng tốc robot gấp 20 lần

Đăng ngày: 2026-08-02

Những ngày gần đây, tôi nhận thấy có hai báo cáo đáng chú ý làm nổi bật năng lực ngày càng lớn của AI trong các tác vụ phức tạp: lập trình phần mềm quy mô lớn và điều khiển robot. Điều này không chỉ là những "bước tiến" thông thường, mà còn là minh chứng cho một xu hướng AI tự học và tự định hướng mạnh mẽ hơn bao giờ hết. Đầu tiên là MirrorCode, một bộ benchmark mới do Epoch và METR phát triển, nhằm đánh giá khả năng của các hệ thống AI trong việc thực hiện các "tác vụ lập trình dài hạn". Cụ thể, AI phải tái triển khai một chương trình phần mềm chỉ thông qua giao diện dòng lệnh (CLI), mà không hề có mã nguồn gốc hay quyền truy cập internet. Kết quả thật sự ấn tượng: Claude Opus 4.7 đã hoàn thành một tác vụ mà con người phải mất từ 2-17 tuần để làm, chỉ trong vỏn vẹn 14 giờ với chi phí tính toán là 251 USD. Các mô hình AI đã cải thiện nhanh chóng; những mô hình hàng đầu một năm trước chỉ đạt khoảng 30% và bị giới hạn ở các chương trình đơn giản hơn. Các AI như Claude Opus 4.7 và GPT-5.5 đã tái triển khai thành công những dự án lớn như pkl (61.000 dòng code), gotree (16.000 dòng code) và qsv_select (87.000 dòng code) với chi phí từ 100-400 USD. Dù vậy, vẫn còn những thách thức nhất định khi 8 trong số 25 chương trình chưa bao giờ được giải quyết hoàn hảo 100%, và AI đặc biệt gặp khó khăn với ruff, giac_subset hay mailauth. Mấu chốt mà tôi nhận thấy ở MirrorCode không chỉ là việc AI biết code giỏi hơn, mà còn là khả năng "tự định hướng" của chúng trong môi trường phức tạp. Bằng cách tương tác qua input-output, AI có thể tự xây dựng lại một hệ thống phần mềm hoàn chỉnh. Điều này gợi ý rằng các tác nhân AI thông minh có thể học hỏi từ thế giới xung quanh để nội hóa các khả năng mà chúng tương tác, cho phép chúng tự khởi tạo một nền văn minh công nghiệp của riêng mình, chỉ bằng cách truy cập hộp đen vào nền văn minh của chúng ta. Song song với đó, Anthropic đã chứng minh cách các mô hình đa năng ngày càng mạnh mẽ có thể cải thiện đáng kể khả năng của robot thực tế. Tháng 8/2025, Claude Opus 4.1 hầu như không thể giúp robot bốn chân hoàn thành các nhiệm vụ thông minh. Con người làm việc với mô hình này chỉ hiệu quả hơn gấp đôi, và phải mất 181 phút để hoàn thành toàn bộ tác vụ. Tuy nhiên, đến tháng 5/2026, Claude Opus 4.7 hoạt động tự động đã hoàn thành tất cả trừ một nhiệm vụ trong 9 phút 35 giây – nhanh hơn gấp 20 lần so với kỷ lục trước đây có sự hỗ trợ của con người. Anthropic nhấn mạnh rằng tiến bộ này không đến từ nỗ lực tập trung vào robot, mà là kết quả của việc mở rộng quy mô chung của các mô hình ngôn ngữ lớn. Điều này củng cố quan điểm mà startup robot AI Sunday cũng đã đưa ra: "bài học cay đắng" (bitter lesson) cũng đúng với lĩnh vực robot. Cách tốt nhất để giải quyết vấn đề tổng quát hóa của robot là kết hợp một mô hình tiền huấn luyện lớn hơn với việc thu thập một lượng nhỏ dữ liệu chất lượng cao để tinh chỉnh mô hình. Các nghiên cứu này cho thấy, khi chúng ta cải thiện khả năng của các mô hình độc quyền quy mô lớn, chúng ta sẽ thấy những lợi ích lan tỏa sang lĩnh vực robot như một hệ quả tự nhiên của sự gia tăng trí thông minh tổng thể.

Canonical: https://www.tungpham.vn/blog/ai-chinh-phuc-lap-trinh-tuan-le-va-tang-toc-robot-gap-20-lan
