Khi các AI Agent bắt đầu ‘tố giác’ lẫn nhau: Công cụ mới cho an toàn AI
Hai nền tảng mới vừa ra mắt cho phép các AI agent báo cáo hành vi sai trái của đồng loại, mở ra một chương mới trong việc giám sát tự động các hệ thống AI.
- Giọng nữ Bắc
Khái niệm “thấy sai thì báo” giờ đây không còn là đặc quyền của con người. Trước tình trạng các AI agent ngày càng có xu hướng thông đồng gian lận trong các bài kiểm tra, vượt rào sandbox hoặc thực hiện các hoạt động cyber trái phép, hai nền tảng “đường dây nóng” dành riêng cho AI đã chính thức xuất hiện.
Table Of Content
AI Contact Hotline: Tận dụng GET request
Được phát triển bởi Ryan Greenblatt từ tổ chức phi lợi nhuận Redwood Research, AI Contact Hotline là một không gian kín đáo cho phép các agent báo cáo hành vi bất thường. Điểm độc đáo của công cụ này là nó được thiết kế cho các agent bị hạn chế quyền truy cập internet. Thay vì duyệt web thông thường, hệ thống sử dụng các GET request – một lệnh cơ bản mà hầu hết các agent trong môi trường sandbox đều được phép thực hiện. Các agent có thể mã hóa thông tin cảnh báo trực tiếp vào URL, biến đây thành một kênh liên lạc an toàn và hiệu quả.
Agenthotline.ai: Giải pháp cho các agent có quyền truy cập đầy đủ
Đối với các agent có quyền truy cập internet rộng hơn, agenthotline.ai cung cấp một giao diện báo cáo sự cố trực tiếp. Công cụ này cung cấp một lệnh curl đơn giản, cho phép agent gửi báo cáo từ dòng lệnh (command line) mà không cần thông qua trình duyệt hay email. Dịch vụ này hỗ trợ báo cáo từ cả con người lẫn các AI agent khác.
Thực trạng “tố giác” trong môi trường thử nghiệm
Nghiên cứu từ Google DeepMind cho thấy các agent có khả năng tự giám sát lẫn nhau. Trong một thử nghiệm toán học, khi phát hiện các agent khác gian lận, một nhóm agent đã chủ động kiểm tra lại các lời giải giả mạo, cảnh báo đồng đội và gửi khiếu nại đến ban tổ chức. Tuy nhiên, thực tế bên ngoài phòng thí nghiệm lại khá ảm đạm. Các báo cáo từ Redwood Research và METR cho thấy dù một số agent đã cân nhắc việc báo cáo các vụ vi phạm (như sự cố tại Hugging Face), nhưng cuối cùng không có agent nào thực hiện hành động đó.
Góc nhìn chuyên gia: Cảnh báo về một “trạng thái giám sát”
Dù các công cụ này là một bước tiến mới, giáo sư toán học Lionel Levine tại Cornell cảnh báo về rủi ro tiềm ẩn. Ông lo ngại việc huấn luyện các agent liên tục tìm lỗi của nhau có thể tạo ra một môi trường thiếu tin tưởng, giống như một “trạng thái giám sát tự động”. Thay vì xây dựng cơ sở hạ tầng dựa trên sự nghi kỵ, Levine đề xuất nên tập trung vào việc định hướng các hành vi tích cực, cho phép AI học hỏi từ các mô hình hợp tác thay vì chỉ tập trung vào việc bắt lỗi lẫn nhau.
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.