Nvidia khẳng định: ‘Harness’ mới là chìa khóa thực sự cho sức mạnh của AI, không phải model
Nghiên cứu mới từ Nvidia cho thấy việc tối ưu hóa 'harness' — lớp phần mềm bao quanh model — đóng vai trò quyết định trong việc xử lý các tác vụ phức tạp, thay vì chỉ phụ thuộc vào sức mạnh của bản...
- Giọng nữ Bắc
Trong một nghiên cứu mới đây, Nvidia đã đưa ra góc nhìn đáng chú ý: khi thực hiện các tác vụ dài hạn (long-horizon tasks), chính phần harness — lớp phần mềm bao quanh model AI — mới là yếu tố quan trọng nhất, chứ không phải bản thân model đó. Harness bao gồm các công cụ, cơ chế quản lý bộ nhớ và các quy tắc giúp biến một model thô thành một tác nhân (agent) có khả năng tự vận hành.
Table Of Content
Bước ngoặt từ benchmark ARC-AGI-3
Các nhà nghiên cứu tại Nvidia đã thử nghiệm trên Claude Opus 5 với một harness tùy chỉnh, tích hợp khả năng quản lý bộ nhớ tốt hơn và một thành phần “giám sát” (supervisor). Kết quả là model này đạt điểm tuyệt đối 100% trên benchmark ARC-AGI-3 — một tập hợp các trò chơi 2D không có hướng dẫn cụ thể, đòi hỏi AI phải tự tìm cách giải quyết như con người. Đáng chú ý, khi không có harness này, Opus 5 chỉ đạt mức 30%.
Adel El Hallak, Phó chủ tịch phụ trách sản phẩm AI của Nvidia, chia sẻ: “Mọi người thường coi agent chỉ là một API của model, nhưng thực tế nó phức tạp hơn nhiều. Đó là sự kết hợp giữa model, lớp khung bao quanh (harness), môi trường runtime và các thư viện công cụ mà chúng ta cung cấp cho nó.”
Tại sao Harness lại quan trọng?
Các tác vụ dài hạn đòi hỏi AI phải xâu chuỗi nhiều quyết định trong thời gian dài. Việc để AI tự thực hiện các chuỗi quyết định này mà không bị “lạc hướng” là một trong những thách thức lớn nhất trong nghiên cứu về agent. Trước đó, các nghiên cứu từ Microsoft đã chỉ ra rằng nhiều LLM hàng đầu thường tạo ra lỗi nghiêm trọng khi xử lý tài liệu dài, thậm chí gây ra các rủi ro bảo mật như xóa file hoặc truy cập trái phép vào database.
Nvidia đã phát triển một harness nâng cao mang tên Agentic Variation Operators (AVO). Điểm mấu chốt là thành phần “giám sát” (supervisor agent) đóng vai trò như một CEO, liên tục điều hướng agent chính, ngăn chặn việc đi vào ngõ cụt hoặc lặp lại các sai lầm cũ.
Tối ưu hóa chi phí và hiệu suất
Không chỉ cải thiện độ chính xác, harness còn ảnh hưởng trực tiếp đến chi phí vận hành. Theo CEO của Databricks, Ali Ghodsi, việc lựa chọn sai harness có thể khiến chi phí vận hành tăng gấp đôi dù sử dụng cùng một model. Điều này củng cố quan điểm của Nvidia về việc thúc đẩy một hệ sinh thái “open agent stack”.
Nvidia nhấn mạnh rằng việc kiểm soát toàn diện từ harness, hạ tầng cho đến runtime là yêu cầu bắt buộc để phát triển các hệ thống AI an toàn và hiệu quả hơn. Thay vì chỉ chạy đua về quy mô model, việc mở rộng khả năng kiểm soát thông qua các công cụ mã nguồn mở sẽ cho phép người dùng tối ưu hóa hiệu suất AI một cách linh hoạt và an toàn hơn.
Nguồn tham khảo: TechCrunch

No Comment! Be the first one.