Cách AI tư duy song song để đàm thoại mạch lạc
OpenAI vừa có động thái nâng cấp chế độ giọng nói của ChatGPT lên một tầm cao mới, mà tôi tạm gọi là GPT-Live theo cách tác giả Simon Willison giới thiệu. Tính năng này được ông Simon trải nghiệm trước vài tuần trên ứng dụng iPhone và nhận định rất ấn tượng. Điểm mấu chốt là khi gặp các tác vụ phức tạp hơn như cần tìm kiếm web, suy luận sâu hay công việc đòi hỏi nhiều tầng phân tích, GPT-Live sẽ âm thầm chuyển giao cho mô hình tiền tuyến mới nhất – ban đầu là GPT-5.5 – xử lý. Điều đáng nói là trong khi mô hình backend đang "vắt óc" làm việc, GPT-Live vẫn có thể tiếp tục trò chuyện với người dùng, duy trì mạch đối thoại không bị gián đoạn. Đây là cải tiến lớn so với phiên bản giọng nói trước đây, vốn dựa trên một mô hình thuộc kỷ nguyên GPT-4o với kiến thức giới hạn tới năm 2024. Cá nhân ông Simon đã từng ngừng dùng chế độ giọng nói cũ vì tuổi đời và năng lực hạn chế của nó khiến ông thấy không còn hữu ích trong vai trò đối tác brainstorming nữa. Trong quá trình dùng thử, ông Simon từng gặp một lỗi khá lạ: mô hình đôi khi tự động ngắt lời để cười những câu ông nói, dù đó không phải là một trò đùa. Ông kể cảm thấy khá thô lỗ và khó chịu, nên đã báo cáo lại cho OpenAI. Theo ông, có vẻ như họ đã điều chỉnh một chút và tình trạng này đã giảm đi đáng kể. Ông còn trích dẫn một đoạn hội thoại nghi là nguyên nhân gây ra tiếng cười ngắt quãng đó: "Vậy cú ở đâu khi chúng không, như là trước hoàng hôn ấy nhỉ? Cú có tồn tại mà, đúng không? Chúng trốn trong hang à? Chúng trốn ở đâu?" Cuộc trò chuyện dài nhất của ông với mô hình mới này kéo dài cả tiếng đồng hồ khi ông đi dạo cùng chó. Khả năng ủy thác tác vụ mà vẫn giữ được mạch hội thoại cho thấy một bước tiến quan trọng trong cách chúng ta tương tác với AI. Nó không chỉ đơn thuần là phản hồi nhanh, mà là một dạng "tư duy song song" – vừa duy trì kết nối ở bề mặt, vừa đào sâu xử lý ngầm. Điều này giúp trải nghiệm người dùng tự nhiên và hiệu quả hơn rất nhiều, nhất là trong các tình huống cần đa nhiệm hoặc khi chúng ta cần AI hỗ