Tư duy hệ thống trong phục vụ mô hình đa phương thức

Khi các mô hình AI đa phương thức (multimodal) ngày càng phổ biến, bài toán tối ưu hiệu suất để phục vụ hàng triệu yêu cầu mỗi ngày trở nên cấp bách. Tôi nhận thấy, đây không chỉ là cuộc đua về sức mạnh phần cứng, mà còn là cuộc chơi về tư duy kiến trúc hệ thống: làm sao để mọi công đoạn được vận hành trơn tru và hiệu quả nhất. Một trong những kỹ thuật tối ưu hóa hiệu suất phục vụ (inference optimization) đáng chú ý là Encode-Prefill-Decode (EPD) disaggregation. Nó hoạt động bằng cách tách rời giai đoạn mã hóa hình ảnh (vision encoder) khỏi hai giai đoạn tiếp theo là prefill (tiền xử lý dữ liệu cho LLM) và decode (tạo ra token đầu ra). Kỹ thuật này đặc biệt hiệu quả với các yêu cầu có nhiều hình ảnh, đầu ra ngắn đến trung bình, và khi dùng các mô hình Mixture-of-Experts (MoE) đã được lượng tử hóa. NVIDIA đã chứng minh rằng EPD, khi tích hợp với framework mã nguồn mở Dynamo, có thể giúp tăng tốc thời gian phản hồi token đầu tiên (Time-to-First-Token - TTFT) lên gấp 5 lần và thời gian phản hồi đầu cuối (end-to-end) nhanh hơn tới 7 lần. Vấn đề cốt lõi của việc phục vụ mô hình đa phương thức theo cách truyền thống (aggregated serving) là các yêu cầu media-heavy (chứa nhiều hình ảnh hoặc video) sẽ khiến cho giai đoạn mã hóa hình ảnh mất nhiều thời gian, có thể lên tới hàng trăm mili giây. Vì giai đoạn mã hóa và hoạt động của LLM cùng chia sẻ một GPU và một luồng lịch trình, một yêu cầu nặng về hình ảnh có thể trì hoãn việc tiền xử lý của chính nó và gây tắc nghẽn cho các yêu cầu khác, kể cả các yêu cầu chỉ có văn bản không cần mã hóa hình ảnh. Với Dynamo, EPD giải quyết chuyện này bằng cách tách bạch vai trò của các worker mã hóa và worker PD (Prefill/Decode). Các worker mã hóa chuyên trách tạo ra các embedding thị giác, sau đó truyền cho các worker PD để chạy LLM, thông qua NVIDIA Inference Transfer Library (NIXL). Việc này cho phép mỗi giai đoạn tự động gom lô (batch), lên lịch và mở rộng quy mô một cách độc lập. Tuy nhiên, EPD không phải là "viên đạn bạc" cho mọi trườ