რა არის ARC-AGI — და რატომ არის მისი დაძლევა AI-სთვის ასე ძნელი?
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.
AI ბენჩმარკები არის სტანდარტიზებული ტესტები, რომლებითაც ადარებენ სხვადასხვა AI მოდელის შესაძლებლობებს ისეთ ამოცანებში, როგორიცაა მსჯელობა, კოდის წერა და მათემატიკა. აქ ვფარავთ, რას ზომავენ ძირითადი ბენჩმარკები, რატომ არ ამბობს ქულა ყოველთვის სრულ სიმართლეს, და თავს ვუყრით სიახლეებს ახალი შედეგების გამოქვეყნებისას. გელოდებათ განმარტებები, რომლებიც ციფრების კრიტიკულად წაკითხვაში დაგეხმარებათ.
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →NVIDIA-ის მკვლევრებმა აჩვენეს, რომ AVO-ს აგენტური არქიტექტურა, რომელიც Claude Opus 5-ს მუდმივი მეხსიერებითა და თვითზედამხედველობით ავსებს, ARC-AGI-3-ის საჯარო ნაკრების ყველა დონეს გაართვა თავი.
ვრცლად →Google DeepMind-ის ყოფილი თანამშრომლების მიერ დაარსებული Inherent Labs-ის თქმით, მისმა 27-მილიარდპარამეტრიანმა აგენტმა Faraday-მ გამოქვეყნებული კვლევების რეპროდუცირებაში Claude Opus 4.8-სა და GPT-5.5-ს აჯობა.
ვრცლად →ახალი საეტალონო ტესტი აჩვენებს, რომ შვიდმა წამყვანმა AI მოდელმა სამეცნიერო ნაშრომის ძირითადი იდეა მხოლოდ მისი ბიბლიოგრაფიის მიხედვით სულ რაღაც 3-15%-ში აღადგინა.
ვრცლად →Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — მოდელი, რომელიც კოდირებასა და აგენტურ ამოცანებში Fable 5-ს უახლოვდება განახევრებულ ფასად და მეცნიერებისა თუ ფინანსების ამოცანებშიც უკეთეს შედეგებს აჩვენებს.
ვრცლად →OpenAI-ის შიდა აუდიტმა აჩვენა, რომ SWE-Bench Pro ბენჩმარქის ამოცანების თითქმის მესამედი წუნდებულია, რის გამოც კომპანიამ დეველოპერებისთვის მისი გამოყენების რეკომენდაცია გააუქმა.
ვრცლად →SpaceXAI-მ გამოუშვა Grok 4.5 — პირველი მოდელი, გაწვრთნილი Cursor-ის მონაცემებზე, რომლის ფასიც Anthropic-ის Opus 4.8-ზე გაცილებით დაბალია, თუმცა საკუთარი ბენჩმარქები შერეულ სურათს იძლევა.
ვრცლად →Z.ai-მ გამოუშვა GLM-5.2 — 744-მილიარდ-პარამეტრიანი ღია კოდის მოდელი, რომელიც GPT-5.5-ს ბევრ ტესტში ჯობნის და Claude Opus 4.8-ს მხოლოდ მცირე ზღვრით ჩამოუვარდება, ნვიდიას ჩიპების გარეშე.
ვრცლად →Meta-ს სუპერინტელექტის ლაბორატორიების ხელმძღვანელმა თანამშრომლებს შიდა შეხვედრაზე განუცხადა, რომ კომპანიის შემდეგი მოდელი — კოდური სახელით Watermelon — ძირითადი ბენჩმარქებით OpenAI-ის GPT-5.5-ს გაუტოლდა; კონკრეტული ტესტები და შედეგები გასაჯაროებული არ არის.
ვრცლად →Mistral-ის ახალი ღია კოდის მოდელი Lean 4-ში ფორმალურ ვერიფიკაციას ავტომატიზებს: miniF2F-ზე 100%, კომპლექსური თეორემების 87% ამოხსნილი, 5 უცნობი შეცდომა კოდბაზებში — ამოცანაზე $4-ად.
ვრცლად →AI ბენჩმარქი სტანდარტიზებული ტესტია, რომელიც სხვადასხვა AI მოდელის შედარების საშუალებს იძლევა. აი, რას ზომავს ყველაზე გავრცელებული ბენჩმარქები — და რატომ არ ყვება ქულები სრულ სიმართლეს.
ვრცლად →OpenAI-მ GeneBench-Pro წარმოადგინა — 129 ამოცანისგან შემდგარი ბენჩმარქი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს გამოთვლითი ბიოლოგიის სფეროში კვლევითი განსჯის უნარი.
ვრცლად →ბეიჯინგის სტარტაპ Z.ai-ს მოდელი GLM-5.2, 16 ივნისს გამოშვებული, კოდირების ტესტებში Claude Opus 4.8-სა და GPT-5.5-ის ტოლ-ღირსია, API-ის ფასი კი ექვსჯერ ნაკლებია.
ვრცლად →ByteDance-მა 23 ივნისს Doubao Seed 2.1 Pro და Turbo გამოუშვა — კომპანია ამბობს, რომ ახალი მოდელები კოდირებისა და agent-ური ამოცანების ბენჩმარკებზე ლიდერობენ და GPT-5.5-ს ეჯიბრებიან.
ვრცლად →ჩინური AI ლაბორატორია Zhipu AI-მ MIT-ლიცენზიით გამოუშვა GLM-5.2 — 753 მილიარდი პარამეტრის ღია მოდელი, რომელიც OpenAI-ის GPT-5.5-ს პროგრამირების ტესტებში სჯობს და ფასადაც მნიშვნელოვნად იაფია.
ვრცლად →Alibaba-ს Qwen-ის გუნდმა გამოაქვეყნა Qwen-AgentWorld — ღია კოდის ენობრივი სამყაროს მოდელების ოჯახი, რომელიც AI აგენტების ქმედებებზე ციფრული გარემოს რეაქციებს პროგნოზირებს. 397B-ის ვარიანტმა AgentWorldBench-ზე GPT-5.4 გადააჭარბა.
ვრცლად →