ARC-AGI არის ბენჩმარკი, რომელიც შედგება თავსატეხებისგან — 2026 წლიდან კი პატარა ინტერაქტიული თამაშებისგანაც — და რომელიც ადამიანისთვის ტრივიალურია, AI-სთვის კი ჯიუტად რთული. მისი შემქმნელია ფრანსუა შოლე, ხოლო დღეს მას წარმართავს არაკომერციული ორგანიზაცია ARC Prize Foundation. ბენჩმარკი არ ამოწმებს, რა დაიმახსოვრა მოდელმა წვრთნისას — ის ამოწმებს, რამდენად კარგად ახერხებს სისტემა უცნობი ამოცანის ამოხსნას სულ რამდენიმე მაგალითის მიხედვით, ისე, როგორც ამას ცნობისმოყვარე ადამიანი გააკეთებდა.
რას ზომავს სინამდვილეში
უმეტესი AI ბენჩმარკი აჯილდოებს „კრისტალიზებულ ინტელექტს" — ცოდნას, რომელიც მოდელმა წვრთნის მონაცემებიდან აითვისა: ფაქტებს, კოდის ნიმუშებს, ხშირად გამოყენებულ ფრაზებს. ARC-AGI კი მიზნად ისახავს „მოქნილ ინტელექტს" — უნარს, იმსჯელო რაღაც ნამდვილად ახალზე, წინასწარი გამოცდილების გარეშე. შოლემ ინტელექტი სწორედ ასე განსაზღვრა 2019 წლის სტატიაში: არა როგორც ის, რასაც სისტემა უკვე იცის, არამედ როგორც ეფექტურობა, რომლითაც ის უცნობ უნარს ითვისებს. სწორედ ამიტომ ბენჩმარკი ინდუსტრიის კამათის ცენტრშია — რა ჩაითვლება სინამდვილეში AGI-დ.
როგორ მუშაობს თავსატეხები
პირველი ARC-AGI-1 (2019) და მისი უფრო რთული მემკვიდრე ARC-AGI-2 (2025) წარმოადგენს ფერადი უჯრედების ბადეებს. თითოეული ამოცანა შეიცავს ორიდან ხუთ მაგალითს — შემავალ ბადეს და ბადეს, რომელშიც ის უნდა გარდაიქმნას — ხოლო ამომხსნელმა უნდა შენიშნოს დამალული წესი და გამოიყენოს ის ახალ შემავალ ბადეზე. საჭირო არ არის არც ენის ცოდნა და არც კულტურული კონტექსტი, რაც ტესტს ყველა ადამიანისთვის თანაბრად სამართლიანს ხდის. თავად შეგიძლიათ სცადოთ თავსატეხები ARC Prize-ის საიტზე — უმეტესობა რამდენიმე წუთში რამდენიმეს ხსნის, ბევრი AI სისტემა კი მათზე სრულად ჩერდება.
ARC-AGI-3-მა, რომელიც 2026 წლის მარტში გაეშვა, ფორმატი მთლიანად შეცვალა. სტატიკური ბადეების ნაცვლად, ის AI აგენტს ათავსებს ასობით ხელით შექმნილ, პატარა სათამაშო გარემოში — ინსტრუქციის, დასახელებული მიზნის ან წესების გარეშე. აგენტმა უნდა გამოიკვლიოს გარემო ცდისა და შეცდომის გზით, თავად მიხვდეს, რას ნიშნავს „მოგება", და გამოცდილება გადაიტანოს თანდათან უფრო რთულ დონეებზე — ისევე, როგორც ადამიანი ისწავლის ახალ ვიდეოთამაშს ინსტრუქციის გარეშე.
რატომ არის ეს ასე რთული AI-სთვის
ჩვეულებრივი AI ბენჩმარკები შესაძლებელია მოტყუებული იქნას მსგავს მაგალითებზე წვრთნით ან უზარმაზარი რაოდენობის მცდელობის უხეში ძალით გადარჩევით. ARC-AGI განზრახ არის აგებული ისე, რომ ამას გაუძლოს: ARC-AGI-2-მ შეფასების ნაკრებიდან ამოიღო ყველა ის ამოცანა, რომელიც ადრინდელმა სისტემებმა უხეში ძალით ამოხსნა, ხოლო თითოეული ახალი ვერსია ნერგავს ამოცანების ისეთ ტიპებს, რომლებიც არც ერთ მოდელს ადრე არ უნახავს. სწორედ ამიტომ, ARC-AGI-ის ქულის ნახტომი ჩვეულებრივ ნამდვილი მსჯელობის პროგრესს ასახავს და არა დაზეპირებას თუ მონაცემთა გაჟონვას — და სწორედ ამიტომ აღნიშნავდა ბენჩმარკი არაერთხელ AI შესაძლებლობების ნამდვილ გარდამტეხ მომენტებს, მსჯელობის მოდელების გაჩენიდან დაწყებული, შესაძლებლობიანი აგენტების აღზევებით დამთავრებული.
როგორ იანგარიშება ქულა
ARC-AGI-3 აგენტებს აფასებს მეტრიკით სახელწოდებით Relative Human Action Efficiency (ადამიანის ქმედების შედარებითი ეფექტურობა). მკვლევრები ჯერ აღრიცხავენ, რამდენი მოძრაობა სჭირდება რეალურ ადამიანებს თითოეული თამაშის პირველად ამოსახსნელად, შემდეგ კი აგენტის მოძრაობათა რაოდენობას ადარებენ ამ საბაზისო მაჩვენებელს: დონის ქულა დაახლოებით (ადამიანის მოძრაობები ÷ აგენტის მოძრაობები)²-ის ტოლია, მაქსიმუმ 1.15-ის ზღვრით. აგენტი, რომელიც საბოლოოდ იმარჯვებს, მაგრამ ადამიანზე ათჯერ მეტ მოძრაობას საჭიროებს, ამ დონეზე თითქმის ნულოვან ქულას მიიღებს — დასრულება საკმარისი არ არის, საჭიროა ეფექტური დასრულებაც. გაშვების დროს ადამიანმა ტესტერებმა საშუალოდ 100% მიიღეს, წამყვანმა მოდელებმა კი — 1%-ზე ნაკლები.
რატომ აქვს მნიშვნელობა
ARC Prize-ის დამფუძნებლების მოსაზრებით, სანამ ადამიანსა და AI სისტემას შორის ახალი რამის სწავლის ეფექტურობაში დიდი უფსკრული არსებობს, ხელოვნური ზოგადი ინტელექტის შესახებ განცხადებები ნაადრევია — მიუხედავად იმისა, რამდენად თავისუფლად ლაპარაკობს მოდელი საუბარში. რადგან ARC-AGI-ის თითოეული ვერსია თავიდან იგება ისე, რომ გვერდის ავლას გაუძლოს, ქულის ნახტომი ერთ-ერთი ყველაზე სანდო საჯარო სიგნალია იმისა, რომ ლაბორატორიამ ნამდვილ პროგრესს მიაღწია მსჯელობაში — და არა უბრალოდ დიდი თუ უკეთ მორგებული მოდელი გამოუშვა. სწორედ ამიტომ ეყრდნობა ბენჩმარკს ახლა კონკურსიც — ARC Prize 2026, რომელიც 2 მილიონ დოლარზე მეტს სთავაზობს გუნდებს, ვინც ამ უფსკრულს შეავიწროებს.
სიახლეებში
ეს უფსკრული 2026 წლის აგვისტოში მკვეთრად შემცირდა ARC-AGI-3-ის საჯარო ლიდერბორდზე, როცა NVIDIA-ის AVO აგენტმა სრულყოფილი ქულა მიიღო საჯარო ტესტის ყველა 183 დონეზე — და ეს მაშინ, როცა თავად Claude Opus 5 მოდელმა, დამოუკიდებლად ამოხსნისას, დონეების მხოლოდ დაახლოებით 30% შეძლო, სანამ მას AVO-ს დაგეგმვისა და მეხსიერების არქიტექტურაში არ „გახვევდნენ". თუმცა არის დათქმაც: ეს ქულა მხოლოდ უფრო მარტივ, საჯარო ნაკრებს ეხება. უფრო რთული, დაფარული ნახევრად კერძო და კერძო ნაკრებები, რომლებსაც ოფიციალურ ARC Prize კონკურსში იყენებენ, AVO-ს ჯერ არ გამოუცდია — ასე რომ, რამდენად ახლოსაა დღევანდელი აგენტები ადამიანის დონის ეფექტურობასთან, ჯერ კიდევ ღია საკითხია.