# Công nghệ điều khiển tạo ảnh AI giúp tăng độ chính xác

Đăng ngày: 2026-10-02

Google Research vừa giới thiệu Diffusion Controller, một khung công nghệ mới giúp điều khiển quá trình tạo ảnh từ văn bản mà không làm giảm chất lượng hình ảnh gốc. Giải pháp này giải quyết bài toán khó trong thiết kế đồ họa bằng AI, nơi các mô hình thường gặp hiện tượng làm theo yêu cầu này nhưng hỏng yêu cầu khác như vừa vẽ đúng con thằn lằn nhưng lại quên mất kính râm, hoặc bắt buộc vẽ kính râm thì mặt con vật lại bị méo mó. CƠ CHẾ HOẠT ĐỘNG NHƯ BỘ GIẢM XÓC LÁI Phương pháp mới này định nghĩa lại quá trình khử nhiễu của AI thành một bài toán điều khiển liên tục thay vì các bước rời rạc. Đội ngũ phát triển ví mô hình tạo ảnh cơ sở như một chiếc mô tô phân khối lớn, việc can thiệp trực tiếp vào lõi mô hình rất phức tạp và rủi ro. Do đó, hệ thống này đóng vai trò như một bộ giảm xóc lái gắn thêm, cho phép giữ nguyên toàn bộ trọng số của mô hình nền mà vẫn tinh chỉnh được quỹ đạo tạo ảnh theo thời gian thực. Quá trình này dựa trên việc kết hợp kiến thức sẵn có của mô hình cơ sở với các hiệu chỉnh nhỏ để tối ưu hóa theo mục tiêu của người dùng. Hệ thống quan sát bức ảnh trong suốt quá trình hình thành từ các hạt tĩnh điện và đưa ra các điều chỉnh vi mô chính xác. Nhờ đó, công cụ này vừa đảm bảo các chi tiết như phụ kiện xuất hiện đầy đủ, vừa kích hoạt các bộ lọc bảo vệ để giữ nguyên tỷ lệ và cấu trúc tự nhiên của chủ thể. HIỆU SUẤT THỰC TẾ VÀ KHẢ NĂNG ỨNG DỤNG Trong các thử nghiệm thực tế sử dụng mô hình nền tảng Stable Diffusion v1.4, nhóm nghiên cứu đã đánh giá khung công nghệ này qua ba phương pháp tinh chỉnh gồm học có giám sát, hàm mất mát có trọng số phần thưởng và học tăng cường dựa trên thuật toán PPO. Hiệu suất được đo lường bằng bộ điểm số sở thích con người tiêu chuẩn là HPS-v2 để kiểm tra mức độ khớp với yêu cầu văn bản và thẩm mỹ. Kết quả ghi nhận phiên bản hộp xám của công cụ này đã vượt qua phương pháp LoRA tiêu chuẩn ngành về tỷ lệ chiến thắng trên thang đo HPS-v2 dù can thiệp vào ít lớp mô hình hơn đáng kể. Đặc biệt, phiên bản mở khóa hoàn toàn đạt tỷ lệ thắng 90% so với mô hình cơ sở trong các bài kiểm tra đánh giá trực quan bởi con người. Người dùng cũng có thể điều chỉnh trực tiếp cường độ kiểm soát ngay trong quá trình chạy mà không làm mất sự ổn định của hình ảnh. Giải pháp này hiện mang lại cách tiếp cận toán học thống nhất cho việc kiểm soát mô hình sinh ảnh thay vì dùng các phương pháp chắp vá trước đây. Khả năng tương thích với cả các mô hình đóng khép kín mở ra hướng đi mới cho việc phát triển các công cụ cá nhân hóa nâng cao, cơ chế lọc nội dung an toàn và điều khiển các mô hình video thế hệ tiếp theo trong tương lai.

Canonical: https://www.tungpham.vn/blog/cong-nghe-dieu-khien-tao-anh-ai-giup-tang-do-chinh-xac
