# Fable 5.1 và bài toán bồ nông đạp xe: khi tư duy AI trở nên phức tạp

Đăng ngày: 2026-09-03

Anthropic vừa giới thiệu Claude Fable 5.1, phiên bản mà họ tự tin tuyên bố "thiết lập một tiêu chuẩn mới cho lập trình, công việc tri thức và các tác vụ giải quyết vấn đề dài hạn". Tôi đặc biệt chú ý đến khả năng xử lý các nghiên cứu khoa học của mô hình này, một lĩnh vực đòi hỏi sự chính xác và tư duy logic cao. Fable 5.1 đã đạt được điểm số 52.6% trên benchmark Terminal-Bench-Science 0.1 mới toanh (vừa được công bố vào ngày 27 tháng 8). Đây là một bước nhảy vọt đáng kể so với các mô hình trước: Fable 5 chỉ đạt 24.7%, Opus 5 là 29.0%, và ngay cả GPT-5.6 Sol cũng chỉ dừng ở mức 22.4%. Dù các benchmark khác chỉ ghi nhận cải thiện nhỏ, kết quả về khoa học này thực sự ấn tượng. Tuy nhiên, một chỉ số khác mà tôi thường dùng để đánh giá độ "nghĩ" của AI, đó là "bài toán bồ nông" (pelican benchmark), lại cho thấy nhiều điều thú vị hơn về cách mô hình này vận hành. Trong bài toán bồ nông kinh điển với lệnh "Generate an SVG of a pelican riding a bicycle", Fable 5.1 cung cấp năm cấp độ lý luận: thấp (low), trung bình (medium), cao (high), cực cao (xhigh) và tối đa (max), mà không có tùy chọn tắt hoàn toàn lý luận. Ở mức "low", mô hình trả về một hình ảnh sau 23.8 giây, với 1,998 output token và tiêu tốn 10.017 cent. Đáng ngạc nhiên là ở cả mức "low" và "medium", Fable 5.1 dường như bỏ qua hoàn toàn bước lý luận tóm tắt; mức "medium" cũng tương tự với 1,977 token, 23 giây và 9.912 cent. Tuy nhiên, mọi thứ bắt đầu thay đổi ở các mức cao hơn. Với mức "high", mô hình có thực hiện một chút lý luận, tập trung vào việc lập kế hoạch bố cục SVG (bầu trời, mặt đất, xe đạp, vị trí chim). Nó mất 29.6 giây, tạo ra 2,612 output token và chi phí 13.087 cent. Nhưng phải đến mức "xhigh", sự khác biệt mới thực sự rõ rệt: mô hình tiêu tốn 7 phút 51 giây, 36,767 output token và 1.83 đô la. Các dấu vết lý luận chi tiết hơn nhiều, bao gồm cả việc "thêm mắt, cánh duỗi xuống tay lái, chân màu cam chạm bàn đạp, lông đuôi nhỏ" và cố tình phóng đại kích thước bồ nông để tạo hiệu ứng hài hước. Ở mức "max", tôi nhận được con bồ nông tốt nhất từ trước đến nay trong các mô hình của Anthropic, dù vẫn chưa đạt được sự tinh tế như Gemini 3.7 Flash. Con bồ nông này hoàn thiện hơn với bối cảnh trang nhã, chân đặt rõ ràng hai bên khung xe, bàn chân trên bàn đạp, cánh trên tay lái, đội mũ xanh và có một giỏ cá. Quá trình này ngốn 13 phút 54 giây, 65,927 output token và 3.30 đô la. Các dấu vết lý luận cho thấy sự cân nhắc tỉ mỉ: từ việc thêm hình dạng bàn đạp, tranh luận giữa mũ bảo hiểm và mào chim, đến điều chỉnh kích thước mũ để không chồng lên mỏ, và thậm chí là xem xét đường cong của phuộc trước. Khi một người dùng trên Hacker News hỏi về phiên bản hoạt hình, tôi đã dùng con bồ nông ở mức "max" và yêu cầu Fable 5.1 ở mức "high" lý luận để "animate this". Kết quả là một video với bánh xe quay sai hướng (có thể do lỗi chuyển đổi MP4) với chi phí 1.37 đô la (6,121 input, 26,201 output token). Qua bài toán bồ nông này, tôi nhận ra Fable 5.1 không chỉ là một cỗ máy mạnh mẽ trong các tác vụ khoa học. Nó còn cho thấy một thế giới nội tại phức tạp của AI, nơi chất lượng, thời gian và chi phí tỷ lệ thuận với mức độ "tư duy" mà chúng ta yêu cầu. AI có thể là công cụ tạo ra những sản phẩm tuyệt vời, nhưng để khai thác triệt để, chúng ta cần hiểu rõ các tầng mức lý luận của nó – và chấp nhận những đánh đổi về tài nguyên.

Canonical: https://www.tungpham.vn/blog/fable-51-va-bai-toan-bo-nong-dap-xe-khi-tu-duy-ai-tro-nen-phuc-tap
