პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.

AI ბენჩმარკები

AI ბენჩმარკები არის სტანდარტიზებული ტესტები, რომლებითაც ადარებენ სხვადასხვა AI მოდელის შესაძლებლობებს ისეთ ამოცანებში, როგორიცაა მსჯელობა, კოდის წერა და მათემატიკა. აქ ვფარავთ, რას ზომავენ ძირითადი ბენჩმარკები, რატომ არ ამბობს ქულა ყოველთვის სრულ სიმართლეს, და თავს ვუყრით სიახლეებს ახალი შედეგების გამოქვეყნებისას. გელოდებათ განმარტებები, რომლებიც ციფრების კრიტიკულად წაკითხვაში დაგეხმარებათ.

გააერთიანეთ:
ARC Prize-ის ლოგო — პიქსელური შრიფტით „ARC PRIZE" და ორი ფერადი კვადრატი, მუქ ფონზე.

რა არის ARC-AGI — და რატომ არის მისი დაძლევა AI-სთვის ასე ძნელი?

ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.

ვრცლად →

NVIDIA-ის AVO აგენტმა ARC-AGI-3-ზე სრულყოფილი ქულა მიიღო

NVIDIA-ის მკვლევრებმა აჩვენეს, რომ AVO-ს აგენტური არქიტექტურა, რომელიც Claude Opus 5-ს მუდმივი მეხსიერებითა და თვითზედამხედველობით ავსებს, ARC-AGI-3-ის საჯარო ნაკრების ყველა დონეს გაართვა თავი.

ვრცლად →

Inherent Labs-ის Faraday-მ Claude-სა და GPT-5.5-ს კვლევის რეპროდუცირებაში აჯობა

Google DeepMind-ის ყოფილი თანამშრომლების მიერ დაარსებული Inherent Labs-ის თქმით, მისმა 27-მილიარდპარამეტრიანმა აგენტმა Faraday-მ გამოქვეყნებული კვლევების რეპროდუცირებაში Claude Opus 4.8-სა და GPT-5.5-ს აჯობა.

ვრცლად →

ახალმა ტესტმა აჩვენა: AI მოდელები კვლევის იდეებს მხოლოდ 3–15%-ში აღადგენენ

ახალი საეტალონო ტესტი აჩვენებს, რომ შვიდმა წამყვანმა AI მოდელმა სამეცნიერო ნაშრომის ძირითადი იდეა მხოლოდ მისი ბიბლიოგრაფიის მიხედვით სულ რაღაც 3-15%-ში აღადგინა.

ვრცლად →

Anthropic-მა Claude Opus 5 გამოუშვა — Fable 5-ს განახევრებულ ფასად უტოლდება

Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — მოდელი, რომელიც კოდირებასა და აგენტურ ამოცანებში Fable 5-ს უახლოვდება განახევრებულ ფასად და მეცნიერებისა თუ ფინანსების ამოცანებშიც უკეთეს შედეგებს აჩვენებს.

ვრცლად →

OpenAI-მ SWE-Bench Pro ბენჩმარქის რეკომენდაცია გააუქმა

OpenAI-ის შიდა აუდიტმა აჩვენა, რომ SWE-Bench Pro ბენჩმარქის ამოცანების თითქმის მესამედი წუნდებულია, რის გამოც კომპანიამ დეველოპერებისთვის მისი გამოყენების რეკომენდაცია გააუქმა.

ვრცლად →

SpaceXAI-მ Grok 4.5 გამოუშვა — იაფია Opus-ზე, ბენჩმარქები შერეულია

SpaceXAI-მ გამოუშვა Grok 4.5 — პირველი მოდელი, გაწვრთნილი Cursor-ის მონაცემებზე, რომლის ფასიც Anthropic-ის Opus 4.8-ზე გაცილებით დაბალია, თუმცა საკუთარი ბენჩმარქები შერეულ სურათს იძლევა.

ვრცლად →

ჩინეთის GLM-5.2 ამერიკის წამყვან AI-ს ექვსჯერ დაბალ ფასად ეჯიბრება

Z.ai-მ გამოუშვა GLM-5.2 — 744-მილიარდ-პარამეტრიანი ღია კოდის მოდელი, რომელიც GPT-5.5-ს ბევრ ტესტში ჯობნის და Claude Opus 4.8-ს მხოლოდ მცირე ზღვრით ჩამოუვარდება, ნვიდიას ჩიპების გარეშე.

ვრცლად →

Meta-ს AI-ის ხელმძღვანელი: ვარჯიშში მყოფი "Watermelon" მოდელი GPT-5.5-ს გაუტოლდა

Meta-ს სუპერინტელექტის ლაბორატორიების ხელმძღვანელმა თანამშრომლებს შიდა შეხვედრაზე განუცხადა, რომ კომპანიის შემდეგი მოდელი — კოდური სახელით Watermelon — ძირითადი ბენჩმარქებით OpenAI-ის GPT-5.5-ს გაუტოლდა; კონკრეტული ტესტები და შედეგები გასაჯაროებული არ არის.

ვრცლად →

Mistral-მა Leanstral 1.5 გამოუშვა — მათემატიკური თეორემებისა და კოდის ვერიფიკაციის ავტომატიზაცია

Mistral-ის ახალი ღია კოდის მოდელი Lean 4-ში ფორმალურ ვერიფიკაციას ავტომატიზებს: miniF2F-ზე 100%, კომპლექსური თეორემების 87% ამოხსნილი, 5 უცნობი შეცდომა კოდბაზებში — ამოცანაზე $4-ად.

ვრცლად →

რა არის AI ბენჩმარქი — და საიდან ვიცით, რომ ერთი მოდელი მეორეზე მართლა უკეთესია?

AI ბენჩმარქი სტანდარტიზებული ტესტია, რომელიც სხვადასხვა AI მოდელის შედარების საშუალებს იძლევა. აი, რას ზომავს ყველაზე გავრცელებული ბენჩმარქები — და რატომ არ ყვება ქულები სრულ სიმართლეს.

ვრცლად →

OpenAI-მ GeneBench-Pro გამოაქვეყნა — AI-ის კვლევითი შესაძლებლობების ბიოლოგიური ბენჩმარქი

OpenAI-მ GeneBench-Pro წარმოადგინა — 129 ამოცანისგან შემდგარი ბენჩმარქი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს გამოთვლითი ბიოლოგიის სფეროში კვლევითი განსჯის უნარი.

ვრცლად →

ჩინური Z.ai-ს GLM-5.2 ამერიკული AI-ის ექვსჯერ იაფად ეჯიბრება

ბეიჯინგის სტარტაპ Z.ai-ს მოდელი GLM-5.2, 16 ივნისს გამოშვებული, კოდირების ტესტებში Claude Opus 4.8-სა და GPT-5.5-ის ტოლ-ღირსია, API-ის ფასი კი ექვსჯერ ნაკლებია.

ვრცლად →

ByteDance-მ Doubao Seed 2.1 წარადგინა — ამბობს, GPT-5.5-ს agent-ურ ამოცანებში ეჯიბრება

ByteDance-მა 23 ივნისს Doubao Seed 2.1 Pro და Turbo გამოუშვა — კომპანია ამბობს, რომ ახალი მოდელები კოდირებისა და agent-ური ამოცანების ბენჩმარკებზე ლიდერობენ და GPT-5.5-ს ეჯიბრებიან.

ვრცლად →

Zhipu AI-ის GLM-5.2 კოდირებაში GPT-5.5-ს სჯობს — ფასი კი ექვსჯერ ნაკლებია

ჩინური AI ლაბორატორია Zhipu AI-მ MIT-ლიცენზიით გამოუშვა GLM-5.2 — 753 მილიარდი პარამეტრის ღია მოდელი, რომელიც OpenAI-ის GPT-5.5-ს პროგრამირების ტესტებში სჯობს და ფასადაც მნიშვნელოვნად იაფია.

ვრცლად →

Alibaba-ს ღია AI სამყაროს მოდელმა GPT-5.4 გადააჭარბა

Alibaba-ს Qwen-ის გუნდმა გამოაქვეყნა Qwen-AgentWorld — ღია კოდის ენობრივი სამყაროს მოდელების ოჯახი, რომელიც AI აგენტების ქმედებებზე ციფრული გარემოს რეაქციებს პროგნოზირებს. 397B-ის ვარიანტმა AgentWorldBench-ზე GPT-5.4 გადააჭარბა.

ვრცლად →