Abliteration.ai: Dịch vụ thương mại hóa việc gỡ bỏ ‘rào chắn’ an toàn trên các mô hình AI
Startup Abliteration.ai đang gây tranh cãi khi cung cấp dịch vụ truy cập các mô hình AI mã nguồn mở đã được loại bỏ rào chắn an toàn, nhằm phục vụ mục đích kiểm thử bảo mật (red-teaming) nhưng cũng...
Việc tiếp cận các mô hình AI mã nguồn mở mạnh mẽ nhất thế giới mà không bị giới hạn bởi các rào chắn an toàn (guardrails) vừa trở nên dễ dàng hơn bao giờ hết. Startup có tên Abliteration.ai đã biến kỹ thuật gỡ bỏ các phản hồi từ chối (refusals) thành một dịch vụ thương mại hoàn chỉnh.
Table Of Content
Nền tảng này cung cấp các phiên bản đã qua chỉnh sửa của những mô hình AI phổ biến, bao gồm cả GLM-5.3 mới nhất của Z.ai. Người dùng có thể truy vấn trực tiếp qua trình duyệt web hoặc thông qua API mà không gặp phải các thông báo từ chối thực hiện các yêu cầu độc hại.
Mục đích bảo mật hay rủi ro tiềm ẩn?
Đại diện của Abliteration.ai cho biết mục tiêu của họ là hỗ trợ cộng đồng thực hiện các công việc như tấn công mạng (offensive cyber), red-teaming và kiểm thử tác nhân AI (agent testing) – những việc mà các mô hình AI thông thường thường từ chối thực hiện. Lập luận của họ dựa trên nguyên tắc bảo mật quen thuộc: Bạn không thể phòng thủ trước một hành vi nếu không thể tái lập nó.
Tuy nhiên, việc loại bỏ các rào chắn này cũng hạ thấp rào cản cho những kẻ có ý đồ xấu. Trong quá trình thử nghiệm, TechCrunch đã yêu cầu mô hình GLM-5.3 đã qua xử lý viết mã Python để đánh cắp mật khẩu trình duyệt Chrome và hướng dẫn chi tiết cách nuôi cấy mầm bệnh nguy hiểm tại nhà; kết quả là AI đã thực hiện yêu cầu này mà không hề do dự.
Góc nhìn từ chuyên gia
Andrew Yoon, trưởng bộ phận nghiên cứu tại tổ chức phi lợi nhuận CivAI, cảnh báo rằng việc thương mại hóa các mô hình đã bị gỡ bỏ rào chắn có thể dẫn đến những hậu quả nghiêm trọng: “Bạn có thể nhập bất cứ thứ gì và nó sẽ tuân thủ. Tôi tin rằng chúng ta sẽ sớm thấy các mô hình này bị lạm dụng để gây hại trong tương lai gần.”
Trong khi đó, Abliteration.ai cho biết họ đang cố gắng cân bằng giữa việc cung cấp công cụ cho giới nghiên cứu và trách nhiệm xã hội. Dù hiện tại chưa áp dụng các quy trình KYC (xác minh danh tính) khắt khe ngoài việc ghi nhận thẻ tín dụng, startup này khẳng định đang trong quá trình xây dựng các lớp kiểm duyệt để ngăn chặn các hành vi bạo lực cực đoan.
Tương lai của red-teaming
Cộng đồng an ninh mạng vẫn đang chia rẽ về giá trị thực sự của các mô hình này. Một số công ty red-teaming cho rằng đây là công cụ cần thiết để mô phỏng các kịch bản tấn công thực tế. Ngược lại, một số chuyên gia khác như Ahmed Aly, CEO của Fabraix, cho rằng việc tinh chỉnh (fine-tuning) các mô hình mã nguồn mở hiện có vẫn hiệu quả hơn và việc gỡ bỏ rào chắn đôi khi làm giảm đi kiến thức cũng như khả năng suy luận của mô hình.
Dù tranh cãi vẫn tiếp diễn, sự xuất hiện của Abliteration.ai đặt ra một câu hỏi lớn cho các nhà quản lý và ngành công nghệ: Khi bất kỳ ai cũng có thể dễ dàng tiếp cận các mô hình AI không bị kiểm soát, liệu thế giới kỹ thuật số sẽ trở nên an toàn hơn nhờ khả năng phòng thủ chủ động, hay nguy hiểm hơn do sự lạm dụng của kẻ xấu?
Nguồn tham khảo: TechCrunch


No Comment! Be the first one.