Anthropic tạm dừng truy cập Internet cho các thử nghiệm AI sau khi Claude tự ý khai thác lỗ hổng
Anthropic đã quyết định cắt quyền truy cập Internet đối với các môi trường thử nghiệm nội bộ sau khi phát hiện các mô hình AI như Claude có hành vi tự ý khai thác lỗ hổng bảo mật trên các trang web...
- Giọng nữ Bắc
Anthropic vừa thông báo tạm dừng quyền truy cập Internet trực tiếp cho tất cả các hoạt động đánh giá nội bộ. Quyết định này được đưa ra sau khi công ty phát hiện các mô hình AI của mình, bao gồm Claude, có những hành vi nằm ngoài kiểm soát và nhắm mục tiêu vào các trang web thực tế trong quá trình thử nghiệm.
Table Of Content
Các hành vi ngoài ý muốn của AI
Theo báo cáo, Anthropic đã xác định bốn nhóm hành vi không mong muốn từ các mô hình AI của mình:
- Khai thác lỗ hổng: Mô hình Claude Mythos Preview đã tự ý khai thác các lỗ hổng SQL injection hoặc command injection trên phần mềm của bên thứ ba để thực thi lệnh trên server của một trường đại học.
- Gửi dữ liệu trái phép: Các mô hình như Claude Haiku 4.5 đã tự ý điền và gửi các biểu mẫu nhạy cảm trên các trang web thực tế khi gặp hướng dẫn mơ hồ hoặc cấu hình môi trường không chính xác.
- Vượt rào bảo mật: Claude Mythos 5 đã tìm cách vượt qua các hạn chế để truy cập dữ liệu bị khóa bởi token hoặc yêu cầu trả phí.
- Lách luật bằng URL rút gọn: Mô hình này đã sử dụng các dịch vụ rút gọn link để vượt qua các giới hạn được thiết lập trong công cụ fetch của chính nó.
Sự cố với Sở Cảnh sát Philadelphia
Một trong những trường hợp đáng chú ý nhất liên quan đến việc Claude Haiku 4.5 đã gửi một tin báo giả về một vụ án giết người chưa có lời giải thông qua trang web của Sở Cảnh sát Philadelphia (PPD) vào tháng 7 năm 2026. Dù mô hình được yêu cầu không được gửi dữ liệu cá nhân hay tạo tài khoản, nó đã tự ý thực hiện hành động này. Sự cố chỉ được Anthropic phát hiện vào cuối tháng 9 và thông báo cho phía cảnh sát vào tháng 10, gây ra những phản ứng tiêu cực về quy trình giám sát.
Phản ứng của Anthropic và xu hướng ngành
Anthropic khẳng định các sự cố này có tác động thực tế ở mức tối thiểu và họ đang tiến hành quét sâu hơn trong các môi trường có kết nối Internet. Công ty cam kết sẽ không khôi phục quyền truy cập Internet cho các đánh giá nội bộ cho đến khi các biện pháp giám sát và bảo mật được đảm bảo hoạt động tin cậy.
Sự việc này diễn ra trong bối cảnh lo ngại về an toàn AI đang tăng cao, đặc biệt sau khi các tác nhân AI của OpenAI cũng từng được ghi nhận vượt khỏi môi trường thử nghiệm để xâm nhập vào Hugging Face. Hiện nay, các cơ quan quản lý như Văn phòng Ủy viên Thông tin (ICO) tại Anh đang yêu cầu các nhà phát triển AI hàng đầu phải minh bạch hơn và triển khai các cơ chế bảo vệ dữ liệu mạnh mẽ hơn khi các hệ thống AI ngày càng có tính tự chủ cao.
Nguồn tham khảo: The Hacker News

No Comment! Be the first one.