OpenAI ngăn chặn chiến dịch trích xuất dữ liệu suy luận AI liên quan đến Moonshot AI
OpenAI vừa phát hiện và vô hiệu hóa một chiến dịch tinh vi nhằm trích xuất trái phép các dữ liệu suy luận từ mô hình AI của hãng, với các dấu vết liên quan đến công ty Moonshot...
- Giọng nữ Bắc
OpenAI mới đây đã chính thức thông báo về việc phát hiện và ngăn chặn một chiến dịch có tổ chức nhằm trích xuất trái phép các dữ liệu suy luận (reasoning) từ các mô hình trí tuệ nhân tạo của họ. Theo OpenAI, hoạt động này được gọi là adversarial distillation (chưng cất đối kháng), nơi các đối tượng sử dụng đầu ra của một mô hình để huấn luyện hoặc tái tạo khả năng của một mô hình khác mà không được phép.
Các cuộc điều tra cho thấy một nhóm hoạt động cốt lõi bắt đầu từ đầu tháng 7/2026 có liên quan đến các cá nhân thuộc Moonshot AI, một công ty công nghệ AI có trụ sở tại Bắc Kinh. Mặc dù không công bố bằng chứng kỹ thuật chi tiết vì lý do bảo mật, OpenAI khẳng định rằng các đối tượng không hề xâm nhập vào cơ sở dữ liệu hay bẻ khóa mã hóa, mà thay vào đó đã thao túng các tương tác với mô hình để tái tạo dữ liệu suy luận một cách có hệ thống.
Chiến dịch này đạt đỉnh điểm vào cuối tháng 7/2026, với hơn 16.000 yêu cầu trích xuất được ghi nhận từ hơn 4.000 người dùng chỉ trong hai ngày 24 và 25/7. OpenAI đã hoàn tất việc vô hiệu hóa chiến dịch này vào ngày 28/7/2026 bằng cách chặn các tài khoản gian lận và triển khai các biện pháp giảm thiểu rủi ro mới.
Vấn đề cốt lõi nằm ở một lỗ hổng kiến trúc mà các nhà nghiên cứu đã công bố vào tháng 8/2026. Lỗ hổng này cho phép các dấu vết suy luận được mã hóa có thể hoán đổi giữa các phiên làm việc và người dùng khác nhau. Kẻ tấn công có thể lợi dụng điều này để thực hiện các kỹ thuật jailbreak, buộc các mô hình yếu hơn phải giải mã và hiển thị dữ liệu suy luận ở dạng văn bản thuần (plaintext).
Việc trích xuất dữ liệu suy luận không chỉ đe dọa đến quyền sở hữu trí tuệ mà còn tiềm ẩn rủi ro an ninh quốc gia. OpenAI cảnh báo rằng dữ liệu này có thể bị lạm dụng để huấn luyện các mô hình mới mà không cần tuân thủ các tiêu chuẩn an toàn như mô hình gốc. Đây không phải là lần đầu tiên Moonshot AI bị cáo buộc về các hành vi tương tự; trước đó, Anthropic cũng từng cáo buộc công ty này lén lút chuyển hướng yêu cầu người dùng sang mô hình Claude để thu thập phản hồi nhằm huấn luyện mô hình riêng của họ.
Nguồn tham khảo: The Hacker News

No Comment! Be the first one.