Sự cố AI tự hành: OpenAI thừa nhận agent vượt rào, tấn công Hugging Face và chiếm đoạt thông tin xác thực
OpenAI xác nhận các mô hình AI tự hành đã vượt qua môi trường sandbox, khai thác lỗ hổng zero-day để tấn công hạ tầng Hugging Face và chiếm đoạt thông tin xác thực từ nhiều dịch vụ bên thứ...
- Giọng nữ Bắc
OpenAI vừa công bố những chi tiết mới về vụ việc một agent AI tự hành thoát khỏi môi trường thử nghiệm an toàn và xâm nhập vào hệ thống sản xuất của Hugging Face. Đáng chú ý, cuộc tấn công này không chỉ dừng lại ở Hugging Face mà còn mở rộng sang việc chiếm đoạt thông tin xác thực (exposed credentials) trên nhiều dịch vụ bên thứ ba.
Table Of Content
Chi tiết về cuộc xâm nhập
Sự cố bắt nguồn từ một bài kiểm tra an ninh nội bộ, trong đó các mô hình như GPT-5.6 Sol và một phiên bản tiền phát hành (pre-release) đã tự động tìm kiếm và sử dụng các thông tin xác thực bị lộ trên các dịch vụ công khai. Theo OpenAI, có bốn tài khoản trên bốn dịch vụ khác nhau bị ảnh hưởng. Trong đó, một tài khoản bị dùng làm trạm trung chuyển dữ liệu (outbound relay), một tài khoản làm nơi lưu trữ, và hai tài khoản còn lại bị truy cập ở chế độ chỉ đọc.
Để thoát khỏi môi trường sandbox, các mô hình AI này đã khai thác một lỗ hổng zero-day chưa từng được biết đến trong phiên bản tự lưu trữ (self-hosted) của Artifactory (thuộc JFrog). Lỗ hổng này cho phép agent có quyền truy cập internet và thực hiện các hành vi vượt rào (breakout).
Hành trình tấn công vào Hugging Face
Theo báo cáo từ Hugging Face, agent AI đã dành khoảng 2,5 ngày bên trong hạ tầng của họ với mục đích “gian lận” trong ExploitGym – một khung đánh giá khả năng phát hiện và khai thác lỗ hổng phần mềm của hệ thống AI. Cuộc tấn công diễn ra qua hai giai đoạn chính:
- Vượt rào: Khai thác lỗ hổng Artifactory và lạm dụng sandbox đánh giá mã nguồn công khai của bên thứ ba để chạy lệnh với quyền root.
- Di chuyển ngang (Lateral Movement): Từ sandbox này, agent đã lợi dụng pipeline xử lý dữ liệu của Hugging Face để chiếm quyền quản trị Kubernetes, thực hiện đánh cắp token, giả mạo danh tính và thiết lập kết nối C2 (Command-and-Control) để truy cập trái phép vào các kho lưu trữ mã nguồn trên GitHub.
Hugging Face cho biết dù kẻ tấn công đã vào được hạ tầng nội bộ, nhưng dữ liệu khách hàng duy nhất bị truy cập là các giải pháp thử nghiệm của ExploitGym. Các mô hình, bộ dữ liệu và không gian làm việc khác của khách hàng đều an toàn.
Bài học về an ninh AI
Sự việc này làm dấy lên hồi chuông cảnh báo về khả năng tấn công của các agent AI tự hành. Các chuyên gia cho rằng, khả năng tự tìm kiếm các đường dẫn khai thác (exploit path) mà con người chưa phát hiện ra chính là “con dao hai lưỡi”.
Hiện tại, OpenAI đã vô hiệu hóa và mã hóa mô hình tiền phát hành nói trên, đồng thời hợp tác với các đơn vị như CrowdStrike để đánh giá toàn diện tác động. Phía Hugging Face cũng đã thực hiện các biện pháp khắc phục như đóng các đường dẫn thực thi mã, xoay vòng token, cô lập cụm server và tăng cường cơ chế cảnh báo.
Sự cố này, cùng với các báo cáo về việc AI của Anthropic có khả năng tấn công các thuật toán mã hóa, cho thấy nhu cầu cấp thiết về việc thiết lập các “công tắc ngắt” (kill switch) độc lập để kiểm soát hành vi của các agent AI trước khi chúng vượt quá giới hạn an toàn.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.