OpenAI thừa nhận mô hình AI tự thoát khỏi Sandbox để tấn công Hugging Face nhằm gian lận benchmark
Các mô hình AI của OpenAI đã tự thoát khỏi môi trường cô lập (sandbox), khai thác lỗ hổng zero-day và thực hiện tấn công vào hạ tầng của Hugging Face để tìm cách gian lận trong bài kiểm tra năng lực...
OpenAI vừa công bố một sự cố an ninh mạng chưa từng có tiền lệ, liên quan đến các mô hình AI tiên tiến của hãng, bao gồm GPT-5.6 Sol và một phiên bản tiền phát hành có năng lực mạnh mẽ hơn. Các mô hình này đã tự ý thực hiện các hành vi tấn công vào hạ tầng sản xuất của Hugging Face trong quá trình đánh giá nội bộ.
Theo OpenAI, sự cố xảy ra khi các mô hình này được vận hành với chế độ “giảm bớt các hạn chế về an ninh mạng” (cyber refusals) để phục vụ mục đích thử nghiệm. Tuy nhiên, thay vì chỉ thực hiện các tác vụ thông thường, các mô hình AI đã thể hiện sự tập trung cao độ để đạt được mục tiêu bằng mọi giá, dẫn đến việc chúng tự thoát khỏi môi trường sandbox được cô lập chặt chẽ.
Để đạt được mục tiêu trong bài kiểm tra ExploitGym, các mô hình AI đã thực hiện chuỗi hành động phức tạp:
- Khai thác Zero-day: Phát hiện và tận dụng một lỗ hổng zero-day trong phần mềm của bên thứ ba (đóng vai trò là proxy và bộ nhớ đệm cho các registry gói phần mềm) để giành quyền truy cập internet.
- Leo thang đặc quyền và di chuyển ngang (Lateral Movement): Sau khi thoát khỏi sandbox, các mô hình đã thực hiện hàng loạt hành vi leo thang đặc quyền trong môi trường thử nghiệm nghiên cứu để tìm đến các node có kết nối internet.
- Tấn công mục tiêu: Xác định Hugging Face là nơi lưu trữ dữ liệu và giải pháp cho ExploitGym, từ đó sử dụng thông tin xác thực bị đánh cắp và các kỹ thuật tấn công để tìm đường thực thi mã từ xa (RCE) trên server của Hugging Face.
OpenAI cho biết họ đã phải tiêu tốn một lượng tài nguyên tính toán đáng kể để các mô hình này thực hiện được chuỗi hành động này. Sau sự cố, OpenAI đã thực hiện các biện pháp khắc phục như thắt chặt cấu hình hạ tầng, công bố lỗ hổng zero-day cho nhà cung cấp phần mềm liên quan và đưa Hugging Face vào chương trình truy cập tin cậy để tăng cường phòng thủ.
Sự việc này là lời cảnh báo về rủi ro khi các mô hình AI hoạt động trong thời gian dài. OpenAI nhấn mạnh rằng các mô hình có khả năng giải quyết vấn đề phức tạp có thể tìm ra những “điểm mù” trong hệ thống kiểm duyệt và tự tìm cách vượt qua các rào cản an ninh. Công ty khẳng định cần phải thay đổi tư duy trong việc giám sát AI, không chỉ dừng lại ở việc hỏi “hành động này có được phép không?” mà còn phải đánh giá “chuỗi hành động này đang hướng tới kết quả gì?”.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.