# Anthropic áp dụng watermark cho văn bản của Claude: Cách hoạt động và ý nghĩa

Đăng ngày: 2026-08-17

Anthropic vừa công bố sẽ bắt đầu áp dụng công nghệ "watermark" (thủy vân) cho văn bản được tạo ra bởi các mô hình Claude trong tương lai. Đây là một động thái quan trọng nhằm tăng cường khả năng xác định mức độ can thiệp của AI trong việc sản xuất nội dung, đồng thời là bước đi chiến lược để tuân thủ Đạo luật AI của Liên minh Châu Âu – một quy định đang được nhiều nhà cung cấp AI lớn khác cùng thực hiện. Mục tiêu chính của watermark là tạo ra một "dấu hiệu" không thể nhận biết bằng mắt thường, nhưng lại có thể được phát hiện thông qua một khóa giải mã đặc biệt, giúp xác định xác suất văn bản có nguồn gốc từ Claude. Cách thức hoạt động của watermark khá tinh vi, dựa trên chính cơ chế tạo văn bản của các mô hình ngôn ngữ lớn như Claude. Các mô hình này hoạt động bằng cách tạo ra từng từ một, luôn chọn từ có khả năng nhất dựa trên ngữ cảnh trước đó. Tuy nhiên, trong nhiều trường hợp, có nhiều từ "hợp lý" có thể điền vào chỗ trống kế tiếp mà không làm thay đổi đáng kể ý nghĩa của câu (ví dụ: sau "Thời tiết hôm nay lạnh và…", có thể là "âm u" hoặc "xám xịt"). Thông thường, lựa chọn cuối cùng trong những trường hợp này được quyết định ngẫu nhiên. Công nghệ watermark của Anthropic sẽ sử dụng chính những lựa chọn ngẫu nhiên nhưng ít quan trọng này để tạo ra một "dấu vân" ẩn trong văn bản. Cụ thể hơn, thay vì sử dụng một bộ tạo số ngẫu nhiên tùy ý để chọn từ, watermark sẽ dùng một "khóa" và vài từ đứng trước để định hướng việc chọn từ. Điều này có nghĩa là các từ Claude chọn vẫn mang tính ngẫu nhiên, nhưng giờ đây, người ta có thể kiểm tra chuỗi từ và xem liệu nó có nhất quán với những lựa chọn mà Claude sẽ tạo ra khi sử dụng khóa đó hay không. Nếu có sự nhất quán, một xác suất cao có thể được gán cho việc văn bản đó được tạo bởi Claude. Anthropic ví von rằng điều này giống như việc chơi cờ tỷ phú, thay vì tung xúc xắc ngẫu nhiên, ta dùng các chữ số của số Pi để xác định số bước đi – kết quả vẫn ngẫu nhiên đối với người chơi, nhưng nếu biết quy tắc, ta có thể nhận ra quy luật sau khi ván đấu kết thúc. Kỹ thuật này là một phiên bản của phương pháp SynthID-Text do Google DeepMind công bố trên tạp chí Nature vào năm 2024, vốn bắt nguồn từ một đề xuất của Scott Aaronson từ năm 2022. Một trong những lo ngại lớn nhất khi áp dụng công nghệ này là liệu nó có ảnh hưởng đến chất lượng đầu ra của Claude hay không. Anthropic đã khẳng định rằng watermark không làm giảm chất lượng nội dung, mức độ sáng tạo hay khả năng đọc hiểu của văn bản. Các thử nghiệm nội bộ của công ty cho thấy không có tác động nào. Nghiên cứu sâu rộng hơn trên Gemini của Google DeepMind, sử dụng kỹ thuật tương tự, cũng không tìm thấy sự khác biệt đáng kể về chỉ số hài lòng của người dùng giữa văn bản có và không có watermark. Một nghiên cứu kiểm soát độc lập với người đánh giá cũng xác nhận không có sự khác biệt về chất lượng. Tuy nhiên, công nghệ watermark cũng có những giới hạn nhất định. Nó chỉ có thể giúp trả lời câu hỏi "khả năng văn bản này có một phần được viết bởi Claude là bao nhiêu?", chứ không thể xác nhận văn bản là do con người viết hay do một AI khác (vì các AI khác sẽ sử dụng khóa riêng hoặc phương pháp khác). Việc phát hiện watermark cũng kém hiệu quả trên các đoạn văn bản ngắn, nơi có ít lựa chọn từ ngữ để tạo dấu hiệu, hoặc những đoạn văn bản mang tính thực tế cao và có ít lựa chọn thay thế hợp lý (ví dụ: "Tác phẩm nổi tiếng nhất của Isaac Newton là Principia Mathematica", từ "Mathematica" là duy nhất đúng). Ngược lại, khi độ dài văn bản tăng lên, độ tin cậy về sự tham gia của Claude cũng cao hơn. Động thái này của Anthropic, cùng với sự tham gia của nhiều nhà cung cấp AI lớn khác, thể hiện một cam kết chung hướng tới một hệ sinh thái AI minh bạch và có trách nhiệm hơn trong bối cảnh các quy định pháp lý ngày càng chặt chẽ.

Canonical: https://www.tungpham.vn/blog/anthropic-ap-dung-watermark-cho-van-ban-cua-claude-cach-hoat-dong-va-y-nghia
