Robot tự học và bài học về sự khó đoán của công nghệ

Tôi thấy cộng đồng AI đang dõi theo từng bước tiến của các hệ thống tự cải thiện, và gần đây, NVIDIA đã tạo ra một vòng lặp tự học khá thô sơ nhưng hiệu quả cho robot vật lý. Họ hình dung chuyện gì sẽ xảy ra nếu những ý tưởng hay nhất từ các tác nhân AI (AI agents) có thể được đưa vào thế giới thực, giúp siêu trí tuệ hiện thực hóa chính nó bằng robot. Dù những ví dụ hiện tại chỉ mang tính gợi ý, đây vẫn là một bước đi đáng chú ý. Phần mềm mà NVIDIA phát triển, gọi là ENPIRE, là một khuôn khổ mạnh mẽ dành cho các tác nhân mã hóa, được thiết kế để thực hiện chu trình phản hồi vật lý với bốn module cốt lõi: Environment (EN) cho việc tự động thiết lập lại và xác minh môi trường, Policy Improvement (PI) để tinh chỉnh các chính sách hoạt động, Rollout (R) để đánh giá các chính sách với một hoặc nhiều robot vật lý hoạt động song song, và Evolution (E) nơi các tác nhân mã hóa phân tích nhật ký, tham khảo tài liệu và cải thiện mã thuật toán để xử lý các lỗi. ENPIRE hoạt động tương tự các tác nhân mã hóa: một hệ thống giám sát các robot vật lý được giao nhiệm vụ. Robot sẽ cố gắng hoàn thành nhiệm vụ, thử nghiệm các chiến lược khác nhau, thất bại và học hỏi. Hệ thống không chỉ đánh giá kết quả mà còn tự động thiết lập lại môi trường khi thất bại. Điều này biến việc học của robot trong thế giới thực thành một quy trình tối ưu hóa có thể quản lý được bởi các tác nhân, giảm thiểu đáng kể nỗ lực của con người. Hai thành phần quan trọng để ENPIRE vận hành trơn tru là hệ thống đánh giá tự động, giúp chấm điểm kết quả mỗi thử nghiệm mà không cần sự can thiệp của con người, và hệ thống thiết lập lại tự động, đưa cảnh vật về trạng thái ban đầu cho lần thử tiếp theo. Về phần cứng, mỗi trạm thí nghiệm bao gồm hai cánh tay YAM (Yet Another Manipulator) từ I2RT trong cấu hình bimanual cố định, một bộ camera và một máy trạm duy nhất chạy máy chủ FastAPI, suy luận chính sách và tác nhân của trạm. Mỗi máy trạm được trang bị một card NVIDIA RTX 5090. Với những trang bị này, các tác nhân mã hóa