Lỗ hổng API trên OpenAI, Anthropic và Google cho phép giải mã suy luận của các mô hình AI mạnh
Các nhà nghiên cứu vừa phát hiện một lỗ hổng trong cách các nhà cung cấp AI lớn xử lý dữ liệu suy luận (reasoning), cho phép kẻ tấn công trích xuất dữ liệu nhạy cảm từ các phiên làm việc thông qua...
- Giọng nữ Bắc
Một lỗ hổng bảo mật mới được tiết lộ trong cơ chế xử lý dữ liệu suy luận (reasoning) của các API từ OpenAI, Anthropic và Google đang đặt ra những thách thức lớn về quyền riêng tư. Lỗ hổng này cho phép kẻ tấn công khôi phục các suy luận nội bộ và thông tin nhạy cảm từ nhật ký phiên làm việc, bao gồm cả khóa API và mật khẩu người dùng.
Vấn đề nằm ở các đối tượng suy luận được mã hóa mà các nhà cung cấp sử dụng trong API của họ. Các nhà nghiên cứu phát hiện rằng một khối dữ liệu được tạo ra trong một phiên làm việc có thể bị phát lại (replay) sang một phiên khác. Đáng chú ý, khi đưa các khối này vào một mô hình AI yếu hơn trong cùng hệ sinh thái, mô hình đó có thể giải mã và tiết lộ nội dung ẩn bên trong.
Nhóm nghiên cứu đã chứng minh bốn kịch bản tấn công nguy hiểm, bao gồm: trích xuất suy luận độc quyền để huấn luyện mô hình (model distillation), lấy cắp dữ liệu riêng tư từ các nhật ký công khai, khôi phục nội dung độc hại bị che giấu sau các câu trả lời an toàn, và ẩn giấu các cuộc tấn công prompt injection bên trong các khối suy luận không minh bạch.
Trong quá trình thử nghiệm trên 6.708 nhật ký đại lý (agent trajectories) công khai, nhóm nghiên cứu đã giải mã thành công hơn 315.000 khối suy luận. Kết quả thu được bao gồm 704 dữ liệu riêng tư thực tế, trong đó có 62 khóa API, 33 mật khẩu, 24 access token và 7 khóa cá nhân.
Các nhà nghiên cứu nhấn mạnh rằng bản thân quá trình mã hóa không bị bẻ khóa. Thay vào đó, cuộc tấn công lợi dụng việc các nhà cung cấp chấp nhận và xử lý các khối dữ liệu “opaque” (không minh bạch) một cách thiếu kiểm soát. Các mô hình như Claude Haiku 4.5, GPT-5.6 Luna hay Gemini Robotics ER-1.6 đã được sử dụng như những bộ giải mã “fuzzy” để chuyển đổi dữ liệu suy luận từ các mô hình mạnh hơn.
Hiện tại, các nhà cung cấp đã thực hiện các biện pháp giảm thiểu rủi ro. Các nhà phát triển được khuyến cáo nên loại bỏ hoàn toàn các khối suy luận và trường dữ liệu không minh bạch khỏi các nhật ký chia sẻ, đồng thời tránh lưu trữ các bản ghi API thô ngay cả khi văn bản hiển thị đã được làm sạch. Mặc dù các cuộc tấn công này hiện không còn khả thi theo báo cáo từ tháng 8/2026, đây vẫn là một lời cảnh báo quan trọng về bảo mật trong kỷ nguyên AI.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.