NVIDIA-ის მკვლევრებმა განაცხადეს, რომ AVO ეწოდებული აგენტურმა არქიტექტურამ ARC-AGI-3-ის — ერთ-ერთი ყველაზე რთული ტესტის, რომელიც ავტონომიური AI აგენტებისთვის შეიქმნა — საჯარო ნაკრების ყველა დონეზე მაქსიმალურ შედეგს მიაღწია. შედეგი 2026 წლის 21 აგვისტოს ტექნიკურ ბლოგპოსტში გამოქვეყნდა, და კომპანიის თქმით, წარმატება არა მხოლოდ მოდელის, არამედ სისტემის დიზაინის დამსახურებაა.

ჩიპის დიზაინიდან აბსტრაქტულ მსჯელობამდე

AVO, ანუ Agentic Variation Operators, თავდაპირველად ARC-AGI-3-ისთვის არ შექმნილა. NVIDIA-მ ის ავტონომიური ევოლუციური ძიების სისტემად შეიმუშავა, რომელიც GPU-ის კერნელებს თავად წერს და აუმჯობესებს: შვიდდღიანი უწყვეტი მუშაობის განმავლობაში მან 500-ზე მეტი ოპტიმიზაციის მიმართულება გამოსცადა და Blackwell GPU-ის ყურადღების ოპერაციებისთვის 40 დამტკიცებული კერნელის ვერსია შექმნა — შედეგად NVIDIA-ის საკუთარ cuDNN ბიბლიოთეკას 3.5%-მდე, ხოლო FlashAttention-4 კერნელს 10.5%-მდე აჯობა, თანდართული კვლევის თანახმად.

იმის შესამოწმებლად, განზოგადდებოდა თუ არა ეს არქიტექტურა კოდის მიღმაც, გუნდმა იგი Claude Opus 5-ს გარშემო მოარგო და ARC-AGI-3 ბენჩმარკზე გამოსცადა. ეს ბენჩმარკი აგენტებს ინსტრუქციების გარეშე უცნობ, თამაშისმაგვარ გარემოში აგდებს და მოელის, რომ წესებს ცდისა და შეცდომის გზით თავად ამოიცნობენ. თუ Claude Opus 5 დამოუკიდებლად, მაღალი მსჯელობის რეჟიმში, საჯარო ნაკრების 183 დონიდან (25 გარემოში) მხოლოდ დაახლოებით 30%-ს წყვეტს, AVO-ს დაგეგმვის, შესრულების, შეფასებისა და მუდმივი მეხსიერების ციკლში იმავე მოდელმა ყველა დონე გაართვა თავი — მიღებულმა Relative Human Action Efficiency ქულამ 100.00-ს მიაღწია.

ეფექტური, მაგრამ არასრული სურათი

AVO-მ VISTA-სთან, საჯარო რეიტინგის ყოფილ ლიდერთან შედარებით, დაახლოებით 12%-ით ნაკლები მოქმედება გამოიყენა — 6,624 მოქმედება, 7,542-ის ნაცვლად — თუმცა NVIDIA აღნიშნავს, რომ ორივე სისტემა დიზაინში საკმარისად განსხვავდება იმისთვის, რომ ეს პირდაპირი, კონტროლირებადი შედარება არ იყოს.

უფრო მნიშვნელოვანი დათქმა მასშტაბს ეხება: სრულყოფილი ქულა მხოლოდ ARC-AGI-3-ის 25 გარემოსგან შემდგარ საჯარო ნაკრებს ფარავს. ბენჩმარკის უფრო რთული, ნახევრად-კერძო და სრულად კერძო ნაკრებები, რომლებსაც ARC Prize-ის კონკურსი რეიტინგისთვის იყენებს და გაცილებით ძნელია მათი „გატყუება”, AVO-ს მიერ ჯერ არ შემოწმებულა. „ფრონტირ ენობრივი მოდელი AI აგენტის მხოლოდ ერთი კომპონენტია, — წერენ მკვლევრები, — გარშემომცველი აგენტური სისტემა… განსაზღვრავს, თუ როგორ იღებს მოდელი კონტექსტს, იყენებს ხელსაწყოებს, ინარჩუნებს მდგომარეობას, პასუხობს უკუკავშირს, აღდგება წარუმატებლობის შემდეგ და ინარჩუნებს პროგრესს ხანგრძლივი ამოცანების დროს.”

ასევე წაიკითხეთ