Vòng lặp tự cải thiện định hình tương lai AI
Tuần này tại AI Engineer World’s Fair, người ta nói nhiều về các vòng lặp trong hệ thống AI. Một khái niệm nổi bật khác là "autoresearch", tức là xây dựng một "vòng lặp bên ngoài" (outer loop) để các agent tự động hỗ trợ duy trì và cải thiện hệ thống chính. Việc này diễn ra nhờ tín hiệu phản hồi, đánh giá (evals) và cả đầu vào từ con người để hệ thống tiến bộ dần theo thời gian. Đây là cách Roland Gavrilescu, đồng sáng lập kiêm CEO của Introspection, một công ty mới chuyên xây dựng hạ tầng cho các hệ thống tự cải thiện này, đã trình bày. Trước khi thành lập Introspection, Gavrilescu từng làm việc về hạ tầng agent và cloud agent tại xAI, nơi anh gặp Julian Bright, người sau này trở thành đồng sáng lập. Tôi được biết họ rời xAI vì muốn tập trung sâu hơn vào một dạng agent mới, điều mà môi trường xAI khi đó chưa phù hợp hoàn toàn. Introspection ra đời từ mong muốn chuyển hóa những ý tưởng thành công từ các công ty như Cursor và Cognition thành một sản phẩm mà nhiều người khác có thể sử dụng. Mục tiêu của autoresearch là tạo ra các vòng lặp để agent tự duy trì hệ thống. Thách thức lớn nhất là thiết kế đúng các tín hiệu và cơ chế phản hồi để agent có thể cải thiện hệ thống, đưa ra quyết định kiến trúc và đi đúng hướng mà không bị con người làm tắc nghẽn liên tục. Tại phiên "Autoresearch in the Wild", Gavrilescu đã giới thiệu ba mô hình cơ bản cho các vòng lặp này trong môi trường sản xuất. Đầu tiên, bản thân "vòng lặp chính là sản phẩm". Chúng ta đã dịch chuyển trọng tâm từ các mô hình (models), sang bộ điều khiển (harnesses), và giờ là các vòng lặp. Câu hỏi cốt lõi là liệu chúng ta có thể định nghĩa được cơ chế phản hồi phù hợp để agent gánh vác nhiều công việc hơn mà không tạo ra thêm sự hỗn độn hay không. Mô hình thứ hai xoay quanh việc vòng lặp tạo ra gì và cách chúng ta theo dõi nó. Introspection đề xuất khái niệm "agent recipe" – một định nghĩa về các thành phần cần thiết và cách chúng phát triển. Tương tự như "data recipe" trong quá trình hậu huấn luyện mô hình, a