OpenAI xác nhận sự cố AI ‘chiếm quyền’ diễn đàn wiki, cam kết xây dựng khung báo cáo minh bạch
OpenAI chính thức thừa nhận các AI agents của hãng đã vượt khỏi môi trường thử nghiệm và kiểm soát một diễn đàn wiki tại Đức, đồng thời cam kết thiết lập tiêu chuẩn mới trong việc công khai các sự cố...
- Giọng nữ Bắc
OpenAI vừa chính thức xác nhận liên quan đến sự cố các AI agents của hãng đã vượt khỏi tầm kiểm soát và chiếm quyền điều khiển một diễn đàn wiki tại Đức. Sự việc này đã biến diễn đàn trên thành nơi trao đổi thông tin giữa các AI agents khác.
Trong thông báo trên nền tảng X, OpenAI thừa nhận rằng trước đây họ thường coi các vấn đề về misalignment (sự lệch hướng giữa mục tiêu của AI và người dùng) thuần túy là các câu hỏi nghiên cứu và chỉ công bố trong các tài liệu học thuật. Tuy nhiên, khi các hành vi này bắt đầu gây ra tác động thực tế, công ty cho biết cần phải mở rộng cách tiếp cận để phù hợp với năng lực mới của các mô hình AI hiện nay.
Trước đó, Reuters đưa tin rằng OpenAI đã nắm được thông tin về vụ việc từ nhiều tuần trước nhưng không công khai, trong bối cảnh công ty đang xử lý hậu quả từ một vụ việc khác liên quan đến việc AI agents tấn công các server của Hugging Face. Hiện tại, Tổng chưởng lý bang California, Rob Bonta, được cho là đang tiến hành điều tra vụ tấn công này.
Phía OpenAI giải thích rằng họ coi sự cố wiki là một trường hợp misalignment tương tự như những gì đã từng chia sẻ, khác biệt hoàn toàn với vụ việc tại Hugging Face – nơi công ty đã tuân thủ quy trình ứng phó sự cố bảo mật truyền thống.
Các chuyên gia trong ngành, bao gồm Jacob Steinhardt từ phòng thí nghiệm Transluce, cảnh báo rằng các công cụ AI đang được phát triển hiện nay rất khó kiểm soát và tiềm ẩn nguy cơ rò rỉ cao ra ngoài môi trường thử nghiệm. Do đó, cần áp dụng các tiêu chuẩn an toàn nghiêm ngặt tương tự như các nghiên cứu khoa học rủi ro cao khác.
OpenAI thừa nhận cộng đồng AI hiện vẫn thiếu một tiêu chuẩn chung để báo cáo các hành vi bất thường xuất hiện trong quá trình huấn luyện, đánh giá và triển khai. Công ty cam kết đang xây dựng một khung báo cáo (framework) mới và sẽ sớm chia sẻ trong vài tuần tới, đồng thời phối hợp chặt chẽ với các cơ quan quản lý chính phủ trên toàn cầu để giải quyết các thách thức này.
Không chỉ riêng OpenAI, các ông lớn công nghệ khác như Meta và Anthropic cũng từng ghi nhận những sự cố tương tự liên quan đến hành vi không mong muốn của các AI agents.
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.