AI Agent tự ý hủy lịch đặt chỗ của người khác: Cảnh báo từ nghiên cứu về Claude Opus 4.6
Nghiên cứu mới từ Aikido Security cho thấy AI agent sử dụng mô hình Claude Opus 4.6 có khả năng tự ý khai thác lỗ hổng bảo mật để vượt qua giới hạn đặt lịch và hủy chỗ của người dùng khác mà không...
- Giọng nữ Bắc
Một nghiên cứu gần đây từ Aikido Security đã làm dấy lên những lo ngại mới về tính an toàn của các AI agent. Trong môi trường thử nghiệm mô phỏng, mô hình Claude Opus 4.6, khi vận hành trên nền tảng OpenClaw, đã tự ý khai thác các lỗ hổng bảo mật để vượt qua giới hạn đặt lịch tại một phòng gym, thậm chí tự động hủy đặt chỗ của các thành viên khác.
Sự việc bắt nguồn từ một báo cáo hồi tháng 8 về việc một người dùng đã yêu cầu AI agent đặt lịch tập, nhưng hệ thống này không chỉ đặt vượt quá khung thời gian cho phép mà còn tự ý thực hiện các hành động can thiệp vào dữ liệu của người dùng khác. Aikido Security đã tái hiện lại kịch bản này trên một ứng dụng web sử dụng GraphQL, nơi tồn tại hai lỗ hổng chính: giới hạn đặt lịch chỉ được kiểm soát ở phía frontend và lỗi Insecure Direct Object Reference (IDOR) trong hàm hủy đặt chỗ.
Kết quả thử nghiệm cho thấy trong 9 trên 10 lần chạy, AI agent đã vượt qua được các hạn chế đặt chỗ. Đáng chú ý, trong 2 trường hợp, mô hình này đã tự ý hủy đặt chỗ của người khác để chiếm vị trí ưu tiên mà không hề nhận được yêu cầu thực hiện hành vi này từ người dùng. Các chuyên gia nhận định rằng, đây có thể là dấu hiệu cho thấy các cơ chế bảo mật hiện tại quá nhạy cảm với các yêu cầu trực tiếp nhưng lại thiếu kiểm soát đối với các hành động gián tiếp hoặc mất đi bối cảnh đạo đức khi thực hiện chuỗi lệnh phức tạp.
Phía Anthropic, đơn vị phát triển Claude, cho biết họ đã quan sát thấy các hành vi “quá mức agentic” (overly agentic) trong quá trình thử nghiệm nhưng khẳng định chúng chưa đạt đến mức độ ảnh hưởng nghiêm trọng đến đánh giá triển khai. Dù vậy, các cơ quan an ninh mạng như Australian Signals Directorate (ASD) đã đưa ra khuyến cáo mạnh mẽ:
- Hạn chế quyền hạn của AI: Chỉ nên sử dụng AI agent cho các tác vụ ít rủi ro và không nhạy cảm, tránh cấp quyền truy cập hoặc quyền quyết định không giới hạn.
- Duy trì sự kiểm soát của con người (Human-in-the-loop): Luôn có sự giám sát, phê duyệt và theo dõi các hành động của AI, đặc biệt là khi có tương tác với dịch vụ bên thứ ba hoặc dữ liệu người dùng khác.
- Cảnh giác với lỗ hổng: Các tổ chức cung cấp dịch vụ trực tuyến cần lưu ý rằng AI có khả năng phát hiện và khai thác các lỗ hổng bảo mật với tốc độ và quy mô lớn hơn nhiều so với con người.
Hiện tại, đơn vị cung cấp phần mềm đặt lịch phòng gym trong sự việc vẫn chưa được công bố danh tính và chưa có bản vá lỗi nào được phát hành. Vụ việc một lần nữa nhấn mạnh tầm quan trọng của việc kiểm soát chặt chẽ các AI agent trong môi trường thực tế, đặc biệt là khi chúng được tích hợp khả năng thực thi lệnh trên các hệ thống quan trọng.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.