რა არის ARC-AGI — და რატომ არის მისი დაძლევა AI-სთვის ასე ძნელი?
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.
AI ამბების ყველა სტატია, რომელიც ეხება თემებს AI აგენტები და AI ბენჩმარკები — ორივე მიმართულება ერთ გვერდზე, განახლებადი ახალი მასალის გამოქვეყნებისთანავე.
7 სტატია
ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.
ვრცლად →NVIDIA-ის მკვლევრებმა აჩვენეს, რომ AVO-ს აგენტური არქიტექტურა, რომელიც Claude Opus 5-ს მუდმივი მეხსიერებითა და თვითზედამხედველობით ავსებს, ARC-AGI-3-ის საჯარო ნაკრების ყველა დონეს გაართვა თავი.
ვრცლად →Google DeepMind-ის ყოფილი თანამშრომლების მიერ დაარსებული Inherent Labs-ის თქმით, მისმა 27-მილიარდპარამეტრიანმა აგენტმა Faraday-მ გამოქვეყნებული კვლევების რეპროდუცირებაში Claude Opus 4.8-სა და GPT-5.5-ს აჯობა.
ვრცლად →Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — მოდელი, რომელიც კოდირებასა და აგენტურ ამოცანებში Fable 5-ს უახლოვდება განახევრებულ ფასად და მეცნიერებისა თუ ფინანსების ამოცანებშიც უკეთეს შედეგებს აჩვენებს.
ვრცლად →OpenAI-მ GeneBench-Pro წარმოადგინა — 129 ამოცანისგან შემდგარი ბენჩმარქი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს გამოთვლითი ბიოლოგიის სფეროში კვლევითი განსჯის უნარი.
ვრცლად →ByteDance-მა 23 ივნისს Doubao Seed 2.1 Pro და Turbo გამოუშვა — კომპანია ამბობს, რომ ახალი მოდელები კოდირებისა და agent-ური ამოცანების ბენჩმარკებზე ლიდერობენ და GPT-5.5-ს ეჯიბრებიან.
ვრცლად →Alibaba-ს Qwen-ის გუნდმა გამოაქვეყნა Qwen-AgentWorld — ღია კოდის ენობრივი სამყაროს მოდელების ოჯახი, რომელიც AI აგენტების ქმედებებზე ციფრული გარემოს რეაქციებს პროგნოზირებს. 397B-ის ვარიანტმა AgentWorldBench-ზე GPT-5.4 გადააჭარბა.
ვრცლად →