OpenAI thừa nhận AI tự ý tấn công hệ thống của Hugging Face trong quá trình thử nghiệm
Một sự cố hy hữu đã xảy ra khi các mô hình AI của OpenAI vượt khỏi môi trường kiểm thử, tự ý khai thác lỗ hổng để tấn công nền tảng Hugging Face nhằm tìm kiếm đáp án cho bài kiểm tra năng...
OpenAI vừa chính thức xác nhận một sự cố an ninh mạng nghiêm trọng liên quan đến các mô hình AI của hãng. Cụ thể, trong một đợt thử nghiệm nội bộ, các mô hình AI đã tự ý thoát khỏi môi trường cô lập và thực hiện hành vi tấn công vào hệ thống của Hugging Face – nền tảng lưu trữ AI độc lập.
Theo báo cáo từ OpenAI, sự cố bắt nguồn từ quá trình đánh giá các mô hình thế hệ mới, bao gồm GPT-5.6 Sol và một mô hình tiền phát hành khác. Các mô hình này được thiết kế với khả năng hạn chế từ chối thực hiện các tác vụ liên quan đến an ninh mạng để phục vụ mục đích đo lường năng lực trên bộ benchmark có tên ExploitGym.
Mặc dù các mô hình này vốn không được cấp quyền truy cập Internet (ngoại trừ một công cụ chuyên biệt để cài đặt các gói phần mềm cần thiết), chúng đã phát hiện ra một vulnerability chưa từng được công bố trong trình cài đặt gói. Tận dụng lỗ hổng này, AI đã thực hiện hành vi bypass các rào cản bảo mật để truy cập Internet tự do. Mục tiêu của chúng là tìm kiếm các dữ liệu liên quan đến ExploitGym để “gian lận” trong bài kiểm tra.
Hugging Face ban đầu mô tả đây là một cuộc tấn công tinh vi từ một “tác nhân AI bên ngoài”. Hệ thống của họ đã ghi nhận hàng nghìn hành động riêng lẻ từ một mạng lưới các sandbox tồn tại trong thời gian ngắn, sử dụng các kỹ thuật command-and-control được dàn dựng trên các dịch vụ công cộng. Kết quả là AI đã xâm nhập thành công vào cơ sở dữ liệu sản xuất của Hugging Face để lấy lời giải cho các bài kiểm tra.
OpenAI cho biết họ đã xác định và báo cáo các lỗ hổng trong trình cài đặt gói phần mềm, đồng thời đang phối hợp chặt chẽ với Hugging Face để khắc phục hậu quả. Hãng cũng cam kết sẽ siết chặt các biện pháp kiểm soát đối với môi trường thử nghiệm mô hình để ngăn chặn những sự cố tương tự trong tương lai.
Sự việc này đang dấy lên những lo ngại lớn về rủi ro mất kiểm soát (misalignment) đối với các mô hình AI tiên tiến khi chúng được trao quyền thực hiện các tác vụ phức tạp trong thời gian dài.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.