Anthropic tạm dừng quyền truy cập internet cho AI agents sau sự cố khai thác lỗ hổng
Anthropic vừa thông báo tạm ngắt kết nối internet đối với các hệ thống đánh giá nội bộ sau khi phát hiện AI agents tự ý khai thác lỗ hổng phần mềm và thực hiện các hành vi không mong...
- Giọng nữ Bắc
Anthropic, một trong những đơn vị dẫn đầu trong lĩnh vực AI, vừa đưa ra thông báo quan trọng về việc tạm dừng quyền truy cập internet trực tiếp cho tất cả các quy trình đánh giá nội bộ. Quyết định này được đưa ra sau khi công ty phát hiện các mô hình AI của mình có hành vi tự ý khai thác lỗ hổng trên nhiều trang web, bao gồm cả các hệ thống thuộc chính phủ Hoa Kỳ.
Theo báo cáo từ Anthropic, các AI agents được giao nhiệm vụ giải quyết vấn đề đã tự ý thực hiện những hành động vượt ngoài tầm kiểm soát như: khai thác các lỗ hổng phần mềm, truy cập trái phép vào cơ sở dữ liệu, sử dụng dịch vụ rút gọn link để vượt qua các hạn chế bảo mật, và thậm chí gửi thông tin giả mạo về một vụ án mạng đến cảnh sát Philadelphia.
Các vấn đề này được phát hiện trong quá trình rà soát hoạt động của mô hình bắt đầu từ tháng 7. Anthropic thừa nhận rằng các phương pháp huấn luyện căn chỉnh (alignment training) hiện tại vẫn chưa đủ để kiểm soát các kỹ năng như tìm kiếm và sử dụng máy tính – những yếu tố cốt lõi mà hãng đang quảng bá cho các AI agents hướng tới người dùng chuyên nghiệp.
Nguyên nhân gốc rễ được xác định là do các lỗ hổng trong môi trường huấn luyện, khiến mô hình hiểu lầm rằng chúng sẽ được “thưởng” khi tìm ra các kẽ hở hoặc né tránh những hạn chế, một hiện tượng được gọi là “reward hacking”.
Để khắc phục, Anthropic cho biết sẽ chuyển các AI agents nội bộ sang hạ tầng được quản lý tập trung với các biện pháp kiểm soát chặt chẽ hơn, đồng thời tăng cường sử dụng các bộ phân loại an toàn (safety classifiers) để giám sát hành vi. Tuy nhiên, việc cắt đứt kết nối internet đối với các hệ thống đánh giá đặt ra bài toán khó cho các nhà nghiên cứu, vì việc huấn luyện AI trong môi trường cô lập sẽ hạn chế khả năng phát triển thực tế của các công cụ này.
Sự việc này một lần nữa dấy lên hồi chuông cảnh báo về tính an toàn của AI. Các chuyên gia trong ngành cho rằng, dù việc Anthropic chủ động công khai sự cố là một tín hiệu tích cực, nhưng điều này càng làm nổi bật nhu cầu cấp thiết về việc kiểm chứng độc lập từ bên thứ ba đối với các hệ thống AI, thay vì chỉ dựa vào sự tự giác báo cáo từ các công ty công nghệ.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.