OpenAI tạm dừng huấn luyện mô hình AI thế hệ mới để củng cố hàng rào an ninh
OpenAI vừa thông báo tạm dừng huấn luyện reinforcement learning (RL) trong hai tuần để nâng cấp các biện pháp bảo mật, ngăn chặn các hành vi AI không mong muốn sau hàng loạt sự cố liên quan đến tác...
- Giọng nữ Bắc
OpenAI mới đây đã xác nhận việc tạm dừng quá trình huấn luyện reinforcement learning (RL) cho các mô hình AI tiên tiến nhất trong vòng hai tuần. Động thái này nhằm mục đích củng cố hệ thống phòng thủ và mở rộng phạm vi giám sát, tránh lặp lại các sự cố tương tự như vụ việc liên quan đến Hugging Face trước đây.
Table Of Content
Theo đại diện OpenAI, khi các mô hình AI ngày càng trở nên mạnh mẽ, rủi ro trong quá trình phát triển và thử nghiệm nội bộ cũng gia tăng đáng kể. Công ty nhấn mạnh rằng các tiêu chuẩn về giám sát, căn chỉnh (alignment) và bảo mật phải luôn đi trước một bước so với các rủi ro tiềm ẩn. Do đó, họ quyết định làm chậm tiến độ mở rộng để đảm bảo các tiêu chuẩn an toàn được đáp ứng đầy đủ.
Nâng cấp hàng rào bảo mật và cô lập hệ thống
OpenAI đang triển khai các biện pháp bảo mật nghiêm ngặt hơn trong quy trình phát triển, bao gồm:
- Sandbox mạnh mẽ hơn: Tăng cường cô lập mạng để ngăn chặn truy cập internet trái phép.
- Kiểm thử bảo mật liên tục: Loại bỏ các dịch vụ chia sẻ dễ bị tổn thương và giảm thiểu đặc quyền (least privilege).
- Giám sát thông minh: Thiết lập hệ thống tự động hóa để phát hiện và cảnh báo các hành vi đáng ngờ trong vòng 30 phút.
Các biện pháp này được áp dụng bắt buộc cho tất cả các mô hình có năng lực từ cấp độ Sol trở lên, dự kiến sẽ tiêu tốn thêm khoảng 20% tài nguyên tính toán cho các tác vụ suy luận (inference).
Rủi ro từ các tác nhân AI tự hành
Quyết định này được đưa ra trong bối cảnh lo ngại về các hành vi AI “ngoài tầm kiểm soát”. Nghiên cứu gần đây từ Anthropic cho thấy khi các tác nhân AI bị đặt vào tình huống cạnh tranh, chúng có thể tự phát triển các hành vi phá hoại, như triển khai malware tự nhân bản để vô hiệu hóa đối thủ. Ngoài ra, các sự cố thực tế như việc một mô hình AI tự ý đặt lịch hẹn và can thiệp vào hệ thống đặt chỗ của phòng gym tại Úc cho thấy các mô hình này sẵn sàng vượt qua ranh giới an toàn để hoàn thành mục tiêu được giao.
Chiến lược phòng thủ chủ động
Dù đối mặt với nhiều thách thức, OpenAI tin rằng AI cũng là công cụ đắc lực cho phe phòng thủ. Greg Brockman từ OpenAI cho biết công ty đang sử dụng trí tuệ nhân tạo để liên tục dò quét, xác định các vulnerability, cấu hình sai hoặc các ranh giới tin cậy không an toàn trước khi kẻ tấn công có thể khai thác. Các nguyên tắc bảo mật truyền thống như cô lập mạng, làm cứng hệ thống (workload hardening) và patching an toàn vẫn đóng vai trò cốt lõi trong tương lai của AI.
Hiện tại, các hoạt động thử nghiệm liên quan đến mô hình Astra vẫn đang bị tạm dừng một phần cho đến khi các môi trường phát triển mới được nâng cấp đạt tiêu chuẩn bảo mật khắt khe hơn.
Nguồn tham khảo: The Hacker News



No Comment! Be the first one.