# Vòng lặp tự cải thiện định hình tương lai AI

Đăng ngày: 2026-07-07

Tuần này tại AI Engineer World’s Fair, người ta nói nhiều về các vòng lặp trong hệ thống AI. Một khái niệm nổi bật khác là "autoresearch", tức là xây dựng một "vòng lặp bên ngoài" (outer loop) để các agent tự động hỗ trợ duy trì và cải thiện hệ thống chính. Việc này diễn ra nhờ tín hiệu phản hồi, đánh giá (evals) và cả đầu vào từ con người để hệ thống tiến bộ dần theo thời gian. Đây là cách Roland Gavrilescu, đồng sáng lập kiêm CEO của Introspection, một công ty mới chuyên xây dựng hạ tầng cho các hệ thống tự cải thiện này, đã trình bày. Trước khi thành lập Introspection, Gavrilescu từng làm việc về hạ tầng agent và cloud agent tại xAI, nơi anh gặp Julian Bright, người sau này trở thành đồng sáng lập. Tôi được biết họ rời xAI vì muốn tập trung sâu hơn vào một dạng agent mới, điều mà môi trường xAI khi đó chưa phù hợp hoàn toàn. Introspection ra đời từ mong muốn chuyển hóa những ý tưởng thành công từ các công ty như Cursor và Cognition thành một sản phẩm mà nhiều người khác có thể sử dụng. Mục tiêu của autoresearch là tạo ra các vòng lặp để agent tự duy trì hệ thống. Thách thức lớn nhất là thiết kế đúng các tín hiệu và cơ chế phản hồi để agent có thể cải thiện hệ thống, đưa ra quyết định kiến trúc và đi đúng hướng mà không bị con người làm tắc nghẽn liên tục. Tại phiên "Autoresearch in the Wild", Gavrilescu đã giới thiệu ba mô hình cơ bản cho các vòng lặp này trong môi trường sản xuất. Đầu tiên, bản thân "vòng lặp chính là sản phẩm". Chúng ta đã dịch chuyển trọng tâm từ các mô hình (models), sang bộ điều khiển (harnesses), và giờ là các vòng lặp. Câu hỏi cốt lõi là liệu chúng ta có thể định nghĩa được cơ chế phản hồi phù hợp để agent gánh vác nhiều công việc hơn mà không tạo ra thêm sự hỗn độn hay không. Mô hình thứ hai xoay quanh việc vòng lặp tạo ra gì và cách chúng ta theo dõi nó. Introspection đề xuất khái niệm "agent recipe" – một định nghĩa về các thành phần cần thiết và cách chúng phát triển. Tương tự như "data recipe" trong quá trình hậu huấn luyện mô hình, agent recipe mô tả cách hệ thống điều khiển làm việc với các mô hình khác nhau, các đánh giá được sử dụng, các "judge" đã tạo, kinh nghiệm chuyên môn của con người được ghi nhận, và những thất bại dẫn đến các đánh giá mới. Một "recipe" như vậy sẽ ghi lại toàn bộ quá trình, bắt đầu từ một trạng thái cơ bản và ghi nhận cách mỗi tín hiệu tạo ra một judge mới, lồng ghép chuyên môn con người, hoặc dẫn đến việc áp dụng một mô hình khác. Điều này giống như một phòng thí nghiệm nghiên cứu, nhưng ở định dạng di động và không phụ thuộc vào nhà cung cấp. Cuối cùng, mô hình thứ ba là về những gì chúng ta tối ưu hóa: làm thế nào để hệ thống vừa tốt hơn vừa rẻ hơn theo thời gian, chắt lọc khả năng của các mô hình tiên tiến vào các hệ thống tùy chỉnh và thuộc sở hữu của doanh nghiệp. Về cấu trúc, chúng ta có thể hình dung hệ thống AI có hai vòng lặp: vòng lặp bên trong (inner loop) là hệ thống chính tương tác với người dùng và thực hiện công việc, còn autoresearch tập trung vào vòng lặp bên ngoài (outer loop) – một hệ thống khác chuyên nghiên cứu và duy trì vòng lặp chính. Vấn đề là làm sao thiết kế vòng lặp bên ngoài hiệu quả mà không tốn quá nhiều tài nguyên khi quyết định những gì cần làm. Introspection cũng ví Pi framework như "Linux của các agent harnesses". Giống như Linux có các bản phân phối nhưng được thiết kế để mở rộng, Pi cũng không dành để chạy như một sản phẩm nguyên bản. Pi tách vòng lặp agent khỏi các tiện ích mở rộng và cấu hình của nó, giúp agent dễ dàng di chuyển. Điều này cho phép người dùng chạy nhiều agent khác nhau chỉ bằng cách tải các tệp khác nhau vào thời gian chạy. Introspection nhìn thấy cơ hội để kết hợp khả năng mở rộng này với các "recipe" và các khối xây dựng mã nguồn mở, cho phép chúng phát triển theo từng khách hàng trong khi vẫn duy trì tính di động và dễ triển khai.

Canonical: https://www.tungpham.vn/blog/vong-lap-tu-cai-thien-dinh-hinh-tuong-lai-ai
