Anthropic hé lộ cơ chế hoạt động của watermark trên chatbot Claude
Anthropic vừa công bố chi tiết kỹ thuật về cách thức triển khai watermark cho nội dung do Claude tạo ra nhằm tuân thủ Đạo luật AI của EU.
- Giọng nữ Bắc
Anthropic vừa chính thức chia sẻ thông tin chi tiết về cách thức triển khai watermark (dấu chìm) cho các nội dung văn bản do chatbot Claude tạo ra. Động thái này nhằm giải đáp những thắc mắc từ cộng đồng người dùng về tính minh bạch và cách thức hoạt động của hệ thống này.
Việc áp dụng watermark là bước đi cần thiết để Anthropic tuân thủ Đạo luật AI của EU (EU AI Act), vốn yêu cầu các công ty công nghệ phải tích hợp hệ thống nhận diện nội dung do AI tạo ra. Dù vấp phải một số phản ứng trái chiều từ người dùng trên các nền tảng như Reddit hay X, Anthropic khẳng định công nghệ này không làm giảm chất lượng phản hồi của mô hình.
Cơ chế kỹ thuật đằng sau watermark
Theo Anthropic, họ sử dụng phương pháp SynthID-Text, vốn được Google DeepMind giới thiệu vào năm 2024. Về cơ bản, khi Claude thực hiện các lựa chọn từ ngữ mang tính chất tương đương (ví dụ: chọn giữa “overcast” và “grey” để mô tả thời tiết), mô hình sẽ tạo ra một mô hình thống kê ẩn. Mô hình này không thể nhận diện bằng mắt thường nhưng có thể phát hiện được nếu sở hữu khóa giải mã (key) tương ứng.
Công ty nhấn mạnh rằng đây là kỹ thuật khác biệt hoàn toàn so với các công cụ phát hiện AI truyền thống vốn chỉ dựa vào việc phân tích các cấu trúc câu đặc trưng (tells). Anthropic cũng có kế hoạch phát hành một API hỗ trợ việc phát hiện watermark này trong tương lai.
Khả năng chống chịu và giới hạn
Về việc liệu người dùng có thể xóa watermark bằng cách chỉnh sửa văn bản hay không, Anthropic cho biết:
- Chỉnh sửa nhẹ: Hầu như không thể loại bỏ hoàn toàn watermark.
- Viết lại hoàn toàn: Nếu thay đổi mọi từ ngữ, watermark sẽ biến mất, nhưng khi đó nội dung cũng không còn được coi là do AI tạo ra.
- Văn bản do người dùng viết: Nếu Claude chỉ đóng vai trò hiệu đính, watermark sẽ khó tồn tại vì phần lớn văn bản gốc thuộc về con người.
Đối với mã nguồn (code), Anthropic giải thích rằng watermark sẽ có ảnh hưởng không đáng kể. Do mã nguồn đòi hỏi tính chính xác về cú pháp, mô hình không có nhiều lựa chọn thay thế từ ngữ như văn bản thông thường. Watermark chỉ có thể được chèn vào các phần như chú thích (comments) trong code.
Anthropic cũng lưu ý rằng họ không đơn độc trong việc này, khi các nhà phát triển mô hình lớn khác cũng đã cam kết thực hiện các tiêu chuẩn tương tự để đảm bảo tính minh bạch trong hệ sinh thái AI toàn cầu.
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.