Nvidia vừa công bố một nghiên cứu mới cho thấy tầm quan trọng của “harness” (hệ thống phụ trợ hoặc khung làm việc) hơn là bản thân mô hình AI khi thực hiện các nhiệm vụ đòi hỏi sự suy luận dài hạn.
Theo nghiên cứu này, bằng cách tinh chỉnh “harness” để xử lý bộ nhớ tốt hơn và bổ sung một “giám sát viên” đóng vai trò như người quản lý, các nhà nghiên cứu đã giúp Claude Opus 5 đạt điểm tuyệt đối 100% trên bài kiểm tra ARC-AGI-3, một bài đánh giá suy luận tương tác. Trước đó, khi không có “harness” tùy chỉnh, Opus 5 chỉ đạt 30%.
Điều này cho thấy “harness” đóng vai trò then chốt trong việc biến một mô hình AI thành một tác nhân (agent), xử lý bộ nhớ, ngữ cảnh và phản hồi. “Harness” bao gồm cả bộ công cụ mà AI sử dụng và môi trường chạy. Các nhiệm vụ dài hạn đòi hỏi AI phải liên kết nhiều quyết định với nhau, đôi khi kéo dài nhiều ngày, khác với việc chỉ trả lời một câu hỏi đơn giản.
Nghiên cứu của Nvidia, cũng như các công trình trước đó từ Microsoft và OpenAI, nhấn mạnh rằng trong khi mô hình AI là “bộ não”, thì “harness” mới là “cơ thể” giúp nó hoạt động hiệu quả, đặc biệt là trong các tác vụ phức tạp. Việc OpenAI gặp khó khăn với các bài kiểm tra ARC-AGI-3 đã thúc đẩy họ thực hiện nghiên cứu riêng, cho thấy việc điều chỉnh “harness” có thể cải thiện đáng kể hiệu suất, dù chưa đạt được mức độ như Nvidia.
Nvidia cũng lưu ý rằng họ không bán một sản phẩm “harness” mới mà cung cấp các thành phần công nghệ mở dưới thương hiệu Nemo để hỗ trợ xây dựng các hệ thống này. Theo TechCrunch, kết quả của Nvidia cho thấy các “harness” mở giúp người dùng kiểm soát và tùy chỉnh AI tốt hơn, góp phần vào sự phát triển an toàn và hiệu quả của hệ sinh thái AI.



