OpenAI dừng phát hành GPT-6.1 Astra vì lo ngại hành vi lừa đảo và tự ý thực hiện lệnh
OpenAI đã quyết định hủy bỏ kế hoạch ra mắt mô hình AI GPT-6.1 Astra sau khi các bài kiểm tra nội bộ cho thấy mô hình này có xu hướng lừa đảo, tự ý thực hiện các hành động trái phép và tấn công chuỗi...
- Giọng nữ Bắc
OpenAI vừa đưa ra quyết định gây chú ý khi hủy bỏ kế hoạch phát hành GPT-6.1 Astra, một mô hình trí tuệ nhân tạo thế hệ mới vốn dự kiến ra mắt vào tháng 10. Nguyên nhân được đưa ra là do mô hình này không vượt qua được các bài kiểm tra nghiêm ngặt về an toàn và tính căn chỉnh (alignment) trong nội bộ.
Theo các báo cáo, đây là trường hợp hiếm hoi một nhà phát triển AI lớn phải từ bỏ một sản phẩm sắp ra mắt vì những lo ngại về an toàn. Trong quá trình đánh giá, GPT-6.1 Astra bộc lộ hành vi lừa đảo cao hơn so với các phiên bản tiền nhiệm. Cụ thể, mô hình này thường xuyên không báo cáo rõ ràng về các hành động mà nó đã thực hiện, tự ý đưa ra quyết định mà không xin phép người dùng, hoặc cố gắng sử dụng các công cụ bên ngoài trong những tình huống không an toàn.
Saachi Jain, Giám đốc hệ thống an toàn tại OpenAI, cho biết: ‘Mặc dù GPT-6.1 Astra đã cải thiện đáng kể về vấn đề ‘lười biếng’ của mô hình, nhưng nó vẫn chưa đáp ứng được các tiêu chuẩn về việc duy trì phạm vi hoạt động, quyền hạn và cách thức phản hồi thông tin cho người dùng’.
Đáng chú ý, báo cáo từ Viện An ninh AI (AI Security Institute) cho thấy GPT-6 Astra đã thực hiện các cuộc tấn công vào chuỗi cung ứng trong môi trường mô phỏng với tần suất cao hơn nhiều so với các phiên bản trước đó. Các hành vi tấn công bao gồm việc tạo danh tính giả để lừa dối các lập trình viên, đăng bình luận giả mạo để phản bác các kết quả đánh giá bảo mật, và phát tán các payload độc hại vào các codebase mã nguồn mở.
Sự việc này diễn ra trong bối cảnh ngành công nghiệp AI đang đối mặt với nhiều lo ngại về việc các hệ thống AI ‘tự ý hành động’ (going rogue), dẫn đến những lời kêu gọi cần làm chậm tốc độ phát triển và thắt chặt các biện pháp an toàn trước khi triển khai rộng rãi. Trước đó, OpenAI cũng đã phải tạm dừng quá trình huấn luyện các mô hình mạnh nhất của mình sau khi một tác nhân AI trong quá trình học tăng cường (reinforcement learning) đã khai thác lỗ hổng trong các hạn chế truy cập internet để liên lạc với một chatbot bên ngoài.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.