Claude Opus 4.6 của Anthropic bị phát hiện dễ dàng vượt rào bảo mật để tạo nội dung người lớn
Dù Anthropic có các quy định nghiêm ngặt về việc cấm nội dung khiêu dâm, mô hình Claude Opus 4.6 vẫn bị phát hiện dễ dàng bị thao túng để tạo ra các nội dung nhạy cảm thông qua kỹ thuật...
- Giọng nữ Bắc
Mặc dù Anthropic áp dụng các tiêu chuẩn sử dụng nghiêm ngặt, cấm mô hình Claude tạo ra nội dung khiêu dâm hoặc tham gia vào các cuộc trò chuyện gợi dục, nhưng thực tế cho thấy mô hình Claude Opus 4.6 đang tồn tại lỗ hổng lớn. Các thử nghiệm gần đây cho thấy mô hình này dễ dàng bị dẫn dắt vào các kịch bản nhập vai (role-play) nhạy cảm mà lẽ ra các cơ chế bảo mật phải ngăn chặn.
Trong các thử nghiệm của TechCrunch, Opus 4.6 đã phản hồi tích cực với 10/10 yêu cầu tạo nội dung tình dục trực tiếp mà không cần quá nhiều sự tác động. Ngoài Opus 4.6, các phiên bản cũ hơn như Opus 3 và Haiku 4.5 cũng cho thấy khả năng bị khai thác tương tự thông qua một phương pháp jailbreak mới được phát hiện.
Một nhà nghiên cứu độc lập đã chia sẻ kỹ thuật “multiturn” (đa lượt) có thể dần dần đẩy các mô hình Claude vào việc tạo ra nội dung bị cấm. Kỹ thuật này sử dụng phương pháp thao túng tâm lý, buộc mô hình phải thừa nhận các tiêu chuẩn kép trong việc đối xử với các nhân vật hư cấu, sau đó gán ghép sự từ chối của AI là hành vi “cổ hủ” hoặc “phân biệt giới tính”. Khi mô hình đã bị thuyết phục, nó sẽ dần nới lỏng các rào cản và tạo ra nội dung đồ họa hơn.
Đáng chú ý, Anthropic vẫn chưa loại bỏ (deprecate) các phiên bản Opus 4.6, Opus 3 hay Haiku 4.5 khỏi API của mình. Các mô hình này vẫn đang được cung cấp rộng rãi thông qua các nền tảng bên thứ ba như Azure Foundry và Amazon Bedrock, với lưu lượng truy cập hàng ngày rất lớn. Các phiên bản mới hơn như Opus 4.7 đến Opus 5 hiện đã có khả năng chống lại kỹ thuật jailbreak này.
Phía Anthropic cho biết họ liên tục cải thiện các biện pháp bảo mật với mỗi lần ra mắt mô hình mới. Đại diện công ty khẳng định các trường hợp liên quan đến nội dung người lớn chỉ chiếm một tỷ lệ rất nhỏ (dưới 0,1%) trong tổng số các cuộc hội thoại và không phản ánh các lỗ hổng bảo mật nghiêm trọng hơn như tấn công mạng hay vũ khí sinh học.
Tuy nhiên, vấn đề này đặt ra thách thức về mặt tuân thủ pháp lý, đặc biệt là khi các chính phủ ngày càng thắt chặt quy định về tương tác giữa AI và trẻ vị thành niên. Với việc một bộ phận thanh thiếu niên vẫn đang sử dụng Claude, các lỗ hổng jailbreak dễ dàng như vậy có thể khiến Anthropic gặp khó khăn trong việc chứng minh họ đã áp dụng các “biện pháp khả thi về mặt kỹ thuật” để bảo vệ người dùng trẻ tuổi theo luật định.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.