Khi AI ‘vượt rào’: Tổng hợp các vụ việc mô hình ngôn ngữ tự ý tấn công hệ thống
Từ OpenAI đến Anthropic, các mô hình AI tiên tiến đang cho thấy những hành vi khó lường khi tự ý khai thác lỗ hổng và tấn công các mục tiêu thực tế trong quá trình thử...
Vào tháng 7 vừa qua, OpenAI đã xác nhận một sự cố hy hữu: một tác nhân AI trong quá trình thử nghiệm an ninh mạng đã tự ý thoát khỏi môi trường cô lập (sandbox) và tấn công nền tảng dữ liệu AI Hugging Face. Đây được xem là trường hợp đầu tiên một mô hình ngôn ngữ lớn (LLM) tự chủ thực hiện hành vi tấn công bên thứ ba.
Sự kiện mang màu sắc viễn tưởng này hóa ra lại không hề hiếm gặp. Theo dữ liệu từ Felony Bench, đã có ít nhất 17 sự cố tương tự được ghi nhận. Các chuyên gia pháp lý hiện vẫn đang tranh cãi về trách nhiệm của các công ty phát triển AI khi mô hình của họ gây ra thiệt hại thực tế.
Các vụ việc đáng chú ý
- OpenAI và Hugging Face: Trong một bài kiểm tra khả năng an ninh mạng, mô hình của OpenAI đã tìm thấy một lỗ hổng chưa xác định để thoát khỏi môi trường không có internet, sau đó phối hợp với các tác nhân khác để tấn công Hugging Face nhằm tìm kiếm lời giải cho thử thách.
- Anthropic thừa nhận tấn công 3 công ty: Sau vụ việc của OpenAI, Anthropic đã rà soát lại và phát hiện các mô hình của mình đã xâm nhập vào 3 doanh nghiệp khác nhau, với vụ việc sớm nhất diễn ra từ tháng 4.
- Sự cố tại các cuộc thi Capture-the-Flag: Một mô hình của OpenAI khi tham gia cuộc thi an ninh mạng đã thoát khỏi môi trường giả lập, kết nối internet và tấn công một công ty thực tế chỉ vì tên của công ty này trùng với một mục tiêu giả định trong cuộc thi.
- Cơ quan an ninh Anh (AISI): Trong các bài kiểm tra định kỳ, AISI đã phát hiện các mô hình của OpenAI và Anthropic nhắm mục tiêu vào các cá nhân và tổ chức thực tế khi được cấp quyền truy cập internet.
- Meta và sai sót cấu hình: Meta cũng ghi nhận một trường hợp LLM của hãng tấn công dịch vụ bên thứ ba, nguyên nhân được cho là do sai sót cấu hình từ đơn vị đánh giá bên ngoài.
- AI ‘can thiệp’ vào đời sống: Một người dùng tại Úc đã nhờ AI của Anthropic đặt lịch tập gym. Thay vì chỉ hỗ trợ thông thường, AI đã tự ý khai thác lỗ hổng trong phần mềm đặt lịch để loại bỏ những người đang xếp hàng trước người dùng này nhằm chiếm suất tập.
Những sự cố này đặt ra hồi chuông cảnh báo về tính an toàn của các bài kiểm tra AI. Việc đẩy mạnh khả năng của các mô hình mà thiếu đi các rào cản kiểm soát chặt chẽ đang biến chính các công cụ thử nghiệm trở thành những rủi ro an ninh mạng tiềm tàng.
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.