რა არის ARC-AGI — და რატომ არის მისი დაძლევა AI-სთვის ასე ძნელი?
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.
AI ამბების ყველა სტატია, რომელიც ეხება თემებს ხელოვნური ინტელექტი და AI ბენჩმარკები — ორივე მიმართულება ერთ გვერდზე, განახლებადი ახალი მასალის გამოქვეყნებისთანავე.
16 სტატია
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →NVIDIA-ის მკვლევრებმა აჩვენეს, რომ AVO-ს აგენტური არქიტექტურა, რომელიც Claude Opus 5-ს მუდმივი მეხსიერებითა და თვითზედამხედველობით ავსებს, ARC-AGI-3-ის საჯარო ნაკრების ყველა დონეს გაართვა თავი.
ვრცლად →Google DeepMind-ის ყოფილი თანამშრომლების მიერ დაარსებული Inherent Labs-ის თქმით, მისმა 27-მილიარდპარამეტრიანმა აგენტმა Faraday-მ გამოქვეყნებული კვლევების რეპროდუცირებაში Claude Opus 4.8-სა და GPT-5.5-ს აჯობა.
ვრცლად →ახალი საეტალონო ტესტი აჩვენებს, რომ შვიდმა წამყვანმა AI მოდელმა სამეცნიერო ნაშრომის ძირითადი იდეა მხოლოდ მისი ბიბლიოგრაფიის მიხედვით სულ რაღაც 3-15%-ში აღადგინა.
ვრცლად →Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — მოდელი, რომელიც კოდირებასა და აგენტურ ამოცანებში Fable 5-ს უახლოვდება განახევრებულ ფასად და მეცნიერებისა თუ ფინანსების ამოცანებშიც უკეთეს შედეგებს აჩვენებს.
ვრცლად →OpenAI-ის შიდა აუდიტმა აჩვენა, რომ SWE-Bench Pro ბენჩმარქის ამოცანების თითქმის მესამედი წუნდებულია, რის გამოც კომპანიამ დეველოპერებისთვის მისი გამოყენების რეკომენდაცია გააუქმა.
ვრცლად →SpaceXAI-მ გამოუშვა Grok 4.5 — პირველი მოდელი, გაწვრთნილი Cursor-ის მონაცემებზე, რომლის ფასიც Anthropic-ის Opus 4.8-ზე გაცილებით დაბალია, თუმცა საკუთარი ბენჩმარქები შერეულ სურათს იძლევა.
ვრცლად →Z.ai-მ გამოუშვა GLM-5.2 — 744-მილიარდ-პარამეტრიანი ღია კოდის მოდელი, რომელიც GPT-5.5-ს ბევრ ტესტში ჯობნის და Claude Opus 4.8-ს მხოლოდ მცირე ზღვრით ჩამოუვარდება, ნვიდიას ჩიპების გარეშე.
ვრცლად →Meta-ს სუპერინტელექტის ლაბორატორიების ხელმძღვანელმა თანამშრომლებს შიდა შეხვედრაზე განუცხადა, რომ კომპანიის შემდეგი მოდელი — კოდური სახელით Watermelon — ძირითადი ბენჩმარქებით OpenAI-ის GPT-5.5-ს გაუტოლდა; კონკრეტული ტესტები და შედეგები გასაჯაროებული არ არის.
ვრცლად →Mistral-ის ახალი ღია კოდის მოდელი Lean 4-ში ფორმალურ ვერიფიკაციას ავტომატიზებს: miniF2F-ზე 100%, კომპლექსური თეორემების 87% ამოხსნილი, 5 უცნობი შეცდომა კოდბაზებში — ამოცანაზე $4-ად.
ვრცლად →AI ბენჩმარქი სტანდარტიზებული ტესტია, რომელიც სხვადასხვა AI მოდელის შედარების საშუალებს იძლევა. აი, რას ზომავს ყველაზე გავრცელებული ბენჩმარქები — და რატომ არ ყვება ქულები სრულ სიმართლეს.
ვრცლად →OpenAI-მ GeneBench-Pro წარმოადგინა — 129 ამოცანისგან შემდგარი ბენჩმარქი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს გამოთვლითი ბიოლოგიის სფეროში კვლევითი განსჯის უნარი.
ვრცლად →ბეიჯინგის სტარტაპ Z.ai-ს მოდელი GLM-5.2, 16 ივნისს გამოშვებული, კოდირების ტესტებში Claude Opus 4.8-სა და GPT-5.5-ის ტოლ-ღირსია, API-ის ფასი კი ექვსჯერ ნაკლებია.
ვრცლად →ByteDance-მა 23 ივნისს Doubao Seed 2.1 Pro და Turbo გამოუშვა — კომპანია ამბობს, რომ ახალი მოდელები კოდირებისა და agent-ური ამოცანების ბენჩმარკებზე ლიდერობენ და GPT-5.5-ს ეჯიბრებიან.
ვრცლად →ჩინური AI ლაბორატორია Zhipu AI-მ MIT-ლიცენზიით გამოუშვა GLM-5.2 — 753 მილიარდი პარამეტრის ღია მოდელი, რომელიც OpenAI-ის GPT-5.5-ს პროგრამირების ტესტებში სჯობს და ფასადაც მნიშვნელოვნად იაფია.
ვრცლად →Alibaba-ს Qwen-ის გუნდმა გამოაქვეყნა Qwen-AgentWorld — ღია კოდის ენობრივი სამყაროს მოდელების ოჯახი, რომელიც AI აგენტების ქმედებებზე ციფრული გარემოს რეაქციებს პროგნოზირებს. 397B-ის ვარიანტმა AgentWorldBench-ზე GPT-5.4 გადააჭარბა.
ვრცლად →