Tại sao mô hình embedding cần mã nguồn mở như EmbeddingGemma 2

Mô hình EmbeddingGemma 2 vừa ra mắt với giấy phép mã nguồn mở Apache 2.0, mang lại giải pháp quan trọng cho bài toán lưu trữ dữ liệu AI. Khác với các mô hình tạo sinh thông thường, phần lớn ứng dụng tích hợp embedding phải tạo và lưu trữ hàng nghìn đến hàng triệu vectơ dữ liệu để phục vụ việc so sánh lâu dài. Quá trình tính toán ra số lượng vectơ khổng lồ này đòi hỏi tài nguyên và chi phí không nhỏ.

Nếu phụ thuộc vào một mô hình đóng độc quyền, doanh nghiệp sẽ rơi vào thế thụ động khi nhà cung cấp ngừng dịch vụ để thay bằng phiên bản mới. Khi mô hình cũ không còn hoạt động, toàn bộ hàng triệu vectơ cũ không thể dùng để so sánh với các vectơ mới, buộc người dùng phải trả chi phí tính toán lại toàn bộ dữ liệu từ đầu. Vào tháng 04 năm 2024, OpenAI từng đưa ra chính sách tài trợ chi phí tạo lại embedding cho người dùng khi họ ra mắt mô hình mới, nhưng đây là trường hợp hiếm hoi và không thể coi là tiêu chuẩn chung cho mọi nhà cung cấp.

Tôi cho rằng mô hình đóng không phải là lựa chọn an toàn cho bài toán embedding. Hướng đi hợp lý nhất là sử dụng dịch vụ cloud hosted để tiết kiệm chi phí hạ tầng ban đầu, nhưng mô hình đó phải có bản quyền mở như Apache 2.0 của EmbeddingGemma 2. Nhờ có bộ trọng số mở, nếu nhà cung cấp dừng dịch vụ, hệ thống vẫn có thể tự vận hành lại chính mô hình đó hoặc chuyển sang một bên thứ ba khác mà không mất trắng dữ liệu vectơ đã tích lũy.