Anthropic tố cáo 7 phòng thí nghiệm AI tại Trung Quốc thực hiện các cuộc tấn công ‘distillation’ quy mô lớn
Anthropic vừa phát hiện và ngăn chặn hàng loạt chiến dịch 'distillation' trái phép, nơi các phòng thí nghiệm AI tại Trung Quốc đánh cắp khả năng của mô hình Claude thông qua các mạng lưới tài khoản...
- Giọng nữ Bắc
Anthropic mới đây đã công bố báo cáo về việc phát hiện và vô hiệu hóa các chiến dịch distillation (chưng cất tri thức) trái phép nhắm vào mô hình AI Claude. Theo công ty, có 7 phòng thí nghiệm AI tại Trung Quốc, bao gồm các tên tuổi lớn như Alibaba, Moonshot, DeepSeek, Zhipu (Z.ai) và MiniMax, đã tham gia vào hoạt động này ở quy mô công nghiệp.
Table Of Content
Distillation trái phép là gì?
Trong khi knowledge distillation là một kỹ thuật huấn luyện máy học hợp pháp (dùng mô hình lớn làm “thầy” để dạy mô hình nhỏ hơn), thì distillation trái phép lại là hành vi đánh cắp khả năng của mô hình mà không được cấp phép. Các tác nhân này thường sử dụng mạng lưới tài khoản giả mạo, thẻ tín dụng bị đánh cắp và API keys thu thập bất hợp pháp để truy cập vào Claude, sau đó ghi lại các phản hồi để huấn luyện mô hình của riêng họ.
Phương thức tấn công tinh vi
Anthropic cho biết các phòng thí nghiệm này sử dụng nhiều thủ đoạn để vượt qua hàng rào bảo mật:
- Sử dụng Proxy/Relay: Định tuyến các yêu cầu thông qua các trạm trung chuyển để che giấu nguồn gốc thực sự.
- Chuyển hướng người dùng: Tự động chuyển hướng yêu cầu từ người dùng của họ sang Claude mà không thông báo, nhằm thu thập dữ liệu hội thoại để huấn luyện mô hình.
- Mua dữ liệu từ bên thứ ba: Thu thập các bản ghi hội thoại giữa người dùng và Claude từ các nhà cung cấp dữ liệu trung gian.
Các chiến dịch tiêu biểu
Báo cáo liệt kê 6 chiến dịch lớn, trong đó nổi bật là GTG-16005 liên quan đến Alibaba, với hơn 151 triệu lượt trao đổi dữ liệu từ tháng 5 đến tháng 7/2026, tập trung vào khả năng suy luận (chain-of-thought) của Claude Opus. Các chiến dịch khác như của Moonshot hay DeepSeek cũng ghi nhận hàng chục triệu lượt truy cập trái phép thông qua hàng ngàn tài khoản giả mạo.
Biện pháp ứng phó từ Anthropic
Để chống lại các cuộc tấn công này, Anthropic đã triển khai nhiều biện pháp kỹ thuật:
- Chặn tài khoản reseller: Loại bỏ các tài khoản hoạt động từ các khu vực không được hỗ trợ hoặc không xác minh được danh tính.
- Tối ưu hóa mô hình: Cập nhật Claude để tóm tắt các suy luận nội bộ trước khi phản hồi, khiến dữ liệu bị đánh cắp trở nên kém giá trị hơn cho việc huấn luyện lại.
- Bảo mật ngữ cảnh: Giới thiệu tính năng preserved thinking trong phiên bản Fable 5.1, ngăn chặn việc can thiệp vào các system prompt hoặc các bước suy luận trong hội thoại đa vòng.
Sự việc này diễn ra trong bối cảnh các cơ quan an ninh mạng Hoa Kỳ đang gia tăng cảnh báo về việc các công ty AI tại Trung Quốc thực hiện hành vi “trích xuất hệ thống” đối với các mô hình AI tiên tiến của Mỹ, gây ra những lo ngại về an ninh quốc gia và sở hữu trí tuệ.
Nguồn tham khảo: The Hacker News
No Comment! Be the first one.