Tencent công bố mô hình MOE mới: HY3

Tencent, một ông lớn công nghệ từ Trung Quốc, vừa công bố mô hình ngôn ngữ lớn (LLM) mới nhất của mình, mang tên Hy3. Được phát triển bởi nhóm Tencent Hy Team và cấp phép Apache 2.0, đây là một mô hình thuộc kiến trúc Mixture-of-Experts (MoE) với tổng cộng 295 tỷ tham số, trong đó có 21 tỷ tham số hoạt động và 3.8 tỷ tham số cho lớp MTP. Để có được phiên bản chính thức này, Tencent đã không ngừng tinh chỉnh kể từ khi ra mắt Hy3 Preview vào cuối tháng 4. Họ đã thu thập phản hồi từ hơn 50 sản phẩm và tiếp tục nâng cấp quá trình hậu huấn luyện bằng cách sử dụng dữ liệu chất lượng cao hơn. Kết quả là Hy3 hiện tại không chỉ vượt trội so với các mô hình cùng kích thước mà còn có khả năng cạnh tranh với các mô hình mã nguồn mở hàng đầu có số lượng tham số gấp 2-5 lần. Đội ngũ phát triển cũng ghi nhận những cải thiện đáng kể về khả năng hữu ích trong nhiều sản phẩm và tác vụ năng suất khác nhau. Về mặt kỹ thuật, Hy3 phiên bản đầy đủ có dung lượng 598GB trên Hugging Face, và một phiên bản FP8 lượng tử hóa nhẹ hơn chỉ 300GB. Điểm đáng chú ý là nó hỗ trợ độ dài ngữ cảnh lên tới 256K, một con số khá ấn tượng. Nếu bạn muốn tự mình trải nghiệm, Hy3 đang được cung cấp miễn phí trên OpenRouter cho đến hết ngày 21 tháng 7. Cá nhân tôi đã thử yêu cầu nó "tạo một SVG hình con bồ nông đang đạp xe" và đã nhận được kết quả khá thú vị. Sự xuất hiện của Hy3 từ Tencent cho thấy một xu hướng rõ ràng trong lĩnh vực AI: không ngừng tối ưu hóa để tạo ra những mô hình mạnh mẽ hơn nhưng vẫn hiệu quả về tài nguyên. Một mô hình 295 tỷ tham số mà có thể đấu ngang ngửa với các đối thủ có tham số gấp nhiều lần là một minh chứng cho thấy hiệu suất không nhất thiết phải đến từ kích thước khổng lồ. Đây là một bước tiến quan trọng, không chỉ củng cố vị thế của Trung Quốc trong cuộc đua AI mà còn mở ra hy vọng về những công cụ AI mạnh mẽ hơn, dễ tiếp cận và vận hành hơn trong tương lai.