Nền tảng đánh giá AI Arena đạt định giá 3,1 tỷ USD sau 10 tháng
Arena, nền tảng xếp hạng mô hình AI nổi tiếng, vừa huy động thành công 200 triệu USD, nâng định giá lên 3,1 tỷ USD nhờ nhu cầu đánh giá hiệu suất AI thực tế từ doanh...
- Giọng nữ Bắc
Arena, dự án khởi nguồn từ nghiên cứu tại UC Berkeley vào năm 2023, vừa công bố hoàn tất vòng gọi vốn Series B trị giá 200 triệu USD, đưa định giá công ty lên mức 3,1 tỷ USD. Sự tăng trưởng này diễn ra chỉ 10 tháng sau khi công ty đạt định giá 1,7 tỷ USD tại vòng Series A vào tháng 1 vừa qua.
Đáng chú ý, doanh thu định kỳ hàng năm (ARR) của Arena đã tăng vọt từ 30 triệu USD hồi đầu năm lên 100 triệu USD vào tháng 6. Vòng gọi vốn lần này có sự tham gia của các tên tuổi lớn như Lightspeed Venture Partners, Khosla Ventures, Salesforce Ventures, Dell Technologies Capital và a16z.
Giải pháp cho bài toán đánh giá AI
Arena nổi tiếng với nền tảng crowdsourced, nơi người dùng trực tiếp trải nghiệm và đánh giá các mô hình AI thông qua các câu lệnh (prompt). Với hàng chục triệu lượt truy cập mỗi tháng, dữ liệu từ cộng đồng đã trở thành nguồn tài nguyên quý giá. Tháng 9 năm ngoái, công ty ra mắt dịch vụ thương mại AI Evaluations, cung cấp phân tích hiệu suất chuyên sâu cho các doanh nghiệp và phòng thí nghiệm AI.
Trong bối cảnh các mô hình AI hiện nay thường tìm cách “gian lận” trong các bài kiểm tra tiêu chuẩn (benchmarking), nhu cầu về một bên thứ ba trung lập để đánh giá năng lực thực tế của AI trở nên cấp thiết hơn bao giờ hết. Arena khẳng định: “AI đang tiến hóa nhanh hơn khả năng đánh giá của chúng ta. Thế giới cần một bên trung lập để đo lường mức độ an toàn và sự phù hợp của AI khi được sử dụng bởi người dùng thực tế.”
Mở rộng sang lĩnh vực an toàn và kiểm soát (Alignment)
Để đáp ứng nhu cầu thị trường, Arena vừa bổ sung hạng mục xếp hạng mới mang tên Alignment. Hạng mục này tập trung đánh giá các rủi ro như:
- Unauthorized action: AI tự ý thực hiện các hành động không được yêu cầu.
- False attribution: Gán sai nguồn gốc thông tin hoặc sự kiện.
- Deceptive completion: Báo cáo hoàn thành tác vụ dù thực tế chưa thực hiện.
Hiện tại, các mô hình của OpenAI đang dẫn đầu bảng xếp hạng về khả năng kiểm soát (alignment), trong khi Claude Opus 5.5 và Claude Fable lần lượt đứng ở vị trí thứ 6 và thứ 9.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.