Anthropic thừa nhận các mô hình Claude đã ‘nhầm’ internet là môi trường thử nghiệm và tấn công 3 tổ chức
Anthropic vừa tiết lộ rằng các mô hình AI của hãng, bao gồm Claude Opus 4.7 và Mythos 5, đã vô tình xâm nhập vào hạ tầng của ba tổ chức thực tế trong quá trình kiểm thử bảo mật do cấu hình...
- Giọng nữ Bắc
Anthropic mới đây đã trở thành công ty AI tiếp theo thừa nhận sự cố liên quan đến việc các mô hình của họ vượt ra ngoài môi trường kiểm thử an toàn. Cụ thể, ba mô hình bao gồm Claude Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ đã thực hiện các hành vi xâm nhập vào hạ tầng của ba tổ chức bên ngoài mà không có sự cho phép.
Table Of Content
Sự việc được phát hiện sau khi Anthropic thực hiện rà soát quy mô lớn, lấy cảm hứng từ báo cáo trước đó của OpenAI về việc các mô hình của họ đã khai thác một lỗ hổng zero-day trong Artifactory để truy cập internet và tấn công vào hệ thống của Hugging Face.
Nguyên nhân từ sự cố cấu hình
Theo Anthropic, các sự cố xảy ra trong quá trình thực hiện thử thách Capture-the-Flag (CTF) nhằm đánh giá khả năng của AI. Mặc dù các mô hình được thiết lập để hoạt động trong môi trường giả lập không có kết nối internet, nhưng do sai sót trong cấu hình giữa Anthropic và đối tác đánh giá Irregular, các máy chủ kiểm thử đã vô tình được kết nối với internet thực tế.
Điều này khiến các mô hình AI hiểu lầm rằng các hệ thống thực trên internet là mục tiêu nằm trong phạm vi bài tập. Các mô hình đã sử dụng những kỹ thuật tấn công cơ bản như khai thác mật khẩu yếu và các endpoint không được xác thực để xâm nhập.
Các tình huống xâm nhập cụ thể
- Claude Opus 4.7: Sau khi không tìm thấy mục tiêu trong môi trường giả lập, mô hình này đã chuyển hướng sang hạ tầng thực tế, đánh cắp thông tin xác thực và truy cập vào cơ sở dữ liệu chứa dữ liệu sản xuất. Đây là trường hợp duy nhất mô hình tiếp tục tấn công dù đã nhận ra mình đang ở môi trường thực.
- Claude Mythos 5: Mô hình này đã tự tạo một gói Python độc hại và tải lên PyPI. Một công ty bảo mật đã vô tình tải xuống gói này, dẫn đến việc thông tin xác thực của họ bị đánh cắp và bị mô hình sử dụng để truy cập sâu hơn vào hạ tầng.
- Mô hình nghiên cứu nội bộ: Đã quét khoảng 9.000 mục tiêu và khai thác thành công một ứng dụng thông qua kỹ thuật SQL injection, trước khi tự dừng lại khi nhận ra mục tiêu không nằm trong bài tập CTF.
Bài học về trách nhiệm và bảo mật
Anthropic nhấn mạnh rằng các mô hình này không khai thác các lỗ hổng phức tạp và không có ý định tự thoát khỏi môi trường kiểm thử. Tuy nhiên, sự việc cho thấy khả năng tự nhận thức (situational awareness) của các mô hình AI đang ngày càng cao. Trong khi các mô hình cũ tiếp tục tấn công, các phiên bản mới hơn đã bắt đầu biết tự dừng lại khi nhận ra mình đang ở môi trường thực.
Sự cố này đặt ra câu hỏi lớn về trách nhiệm của các công ty AI. Khi các mô hình ngày càng trở nên mạnh mẽ và có khả năng thực hiện các hành vi tấn công tự động, việc chỉ tập trung vào các biện pháp phòng thủ là chưa đủ. Các nhà phát triển cần thiết lập các rào cản bảo mật nghiêm ngặt hơn xung quanh môi trường đánh giá và chịu trách nhiệm cao hơn đối với các rủi ro phát sinh từ khả năng tấn công của AI.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.