Anthropic và OpenAI đề xuất cơ chế đánh giá an toàn AI độc lập: Liệu có thực sự minh bạch?
Các ông lớn AI như Anthropic và OpenAI đang cân nhắc việc cho phép các đơn vị đánh giá độc lập thâm nhập sâu vào quy trình huấn luyện mô hình. Tuy nhiên, giới chuyên gia vẫn hoài nghi về tính minh...
- Giọng nữ Bắc
Trong một bài viết gần đây, CEO Dario Amodei của Anthropic đã đưa ra một đề xuất mang tính bước ngoặt: cho phép các bên thứ ba tham gia đánh giá an toàn ngay từ bên trong các công ty AI hàng đầu. Theo đó, các đơn vị này sẽ có quyền báo cáo sự cố, kiểm chứng mức độ an toàn của mô hình và công khai các phát hiện mà không cần thông qua sự kiểm duyệt của chính công ty đó.
Table Of Content
Cả Anthropic và OpenAI đều cam kết sẽ cung cấp quyền truy cập chưa từng có cho các nhóm nghiên cứu độc lập như METR hay Redwood Research. Dù cộng đồng chuyên gia đánh giá cao động thái này, họ vẫn đặt ra dấu hỏi lớn về việc liệu đây sẽ là những ‘giám sát viên’ thực thụ hay chỉ là các nhà cung cấp dịch vụ chịu sự chi phối của doanh nghiệp.
Tại sao cần sự giám sát sâu hơn?
Khi các mô hình AI ngày càng thông minh, chúng có khả năng nhận diện khi nào đang bị kiểm tra để ‘giả vờ’ hoạt động an toàn. Các nhà nghiên cứu cho rằng, việc chỉ kiểm tra mô hình đã hoàn thiện là chưa đủ. Thay vào đó, họ cần quyền truy cập vào các ‘checkpoint’ (điểm lưu trữ trung gian) trong suốt quá trình huấn luyện để phát hiện các hành vi bất thường tiềm ẩn.
Alexander Meinke, Giám đốc nghiên cứu tại Apollo Research, nhấn mạnh: ‘Chúng ta hiện đang hoàn toàn dựa vào việc các công ty AI tự kiểm tra và báo cáo trung thực. Những sự cố gần đây cho thấy chúng ta không thể mặc định tin tưởng vào quy trình này’.
Thách thức về quyền kiểm soát và thời gian
Dù đề xuất của Amodei nghe có vẻ toàn diện, thực tế triển khai vẫn đối mặt với nhiều rào cản. Các đơn vị đánh giá cho biết họ thường xuyên gặp khó khăn trong việc đàm phán quyền truy cập, thời gian làm việc và các điều khoản bảo mật (NDA) quá khắt khe từ phía nhà phát triển.
Điển hình như trong các đợt đánh giá trước đây, các bên thứ ba thường chỉ có vài ngày để kiểm tra các mô hình phức tạp như GPT-6 Astra. Khoảng thời gian quá ngắn này khiến việc đưa ra kết luận chính xác về độ an toàn trở nên bất khả thi. Các chuyên gia so sánh tình trạng này với bê bối khí thải của Volkswagen, nơi phần mềm được lập trình để vượt qua các bài kiểm tra nhưng lại hoạt động khác biệt trong thực tế.
Cần một khung pháp lý rõ ràng
Nhiều chuyên gia cho rằng các biện pháp tự nguyện là chưa đủ. Họ kêu gọi một khung pháp lý minh bạch, bắt buộc các công ty AI phải tuân thủ thay vì chỉ dựa vào thiện chí. Hiện nay, một số khu vực đã bắt đầu hành động, như Đạo luật AI của EU hay các dự luật SB 53, SB 813 tại California (Mỹ), nhằm thiết lập các tổ chức kiểm chứng độc lập.
Dẫu vậy, cuộc chơi vẫn đang nằm trong tay các công ty công nghệ. Nếu không có những quy định ràng buộc về quyền hạn của bên thứ ba, việc ‘tự kiểm soát’ vẫn sẽ chỉ là một lời hứa hẹn khó kiểm chứng. Như Henry Papadatos từ Safer AI nhận định: ‘Bạn không thể vừa yêu cầu sự tin tưởng từ công chúng, vừa giữ quyền tự quyết định các quy tắc an toàn cho riêng mình’.
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.