პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.

AI აგენტებიდა AI ბენჩმარკები

AI ამბების ყველა სტატია, რომელიც ეხება თემებს AI აგენტები და AI ბენჩმარკები — ორივე მიმართულება ერთ გვერდზე, განახლებადი ახალი მასალის გამოქვეყნებისთანავე.

მონიშნული თეგები: AI აგენტები × AI ბენჩმარკები ×

7 სტატია

ARC Prize-ის ლოგო — პიქსელური შრიფტით „ARC PRIZE" და ორი ფერადი კვადრატი, მუქ ფონზე.

რა არის ARC-AGI — და რატომ არის მისი დაძლევა AI-სთვის ასე ძნელი?

ARC-AGI არის თავსატეხებისა და თამაშების ბენჩმარკი, რომელიც ადამიანისთვის მარტივია, AI-სთვის კი — არა; ის ამოწმებს ნამდვილ მსჯელობას, დაზეპირებული ცოდნის ნაცვლად.

ვრცლად →

NVIDIA-ის AVO აგენტმა ARC-AGI-3-ზე სრულყოფილი ქულა მიიღო

NVIDIA-ის მკვლევრებმა აჩვენეს, რომ AVO-ს აგენტური არქიტექტურა, რომელიც Claude Opus 5-ს მუდმივი მეხსიერებითა და თვითზედამხედველობით ავსებს, ARC-AGI-3-ის საჯარო ნაკრების ყველა დონეს გაართვა თავი.

ვრცლად →

Inherent Labs-ის Faraday-მ Claude-სა და GPT-5.5-ს კვლევის რეპროდუცირებაში აჯობა

Google DeepMind-ის ყოფილი თანამშრომლების მიერ დაარსებული Inherent Labs-ის თქმით, მისმა 27-მილიარდპარამეტრიანმა აგენტმა Faraday-მ გამოქვეყნებული კვლევების რეპროდუცირებაში Claude Opus 4.8-სა და GPT-5.5-ს აჯობა.

ვრცლად →

Anthropic-მა Claude Opus 5 გამოუშვა — Fable 5-ს განახევრებულ ფასად უტოლდება

Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — მოდელი, რომელიც კოდირებასა და აგენტურ ამოცანებში Fable 5-ს უახლოვდება განახევრებულ ფასად და მეცნიერებისა თუ ფინანსების ამოცანებშიც უკეთეს შედეგებს აჩვენებს.

ვრცლად →

OpenAI-მ GeneBench-Pro გამოაქვეყნა — AI-ის კვლევითი შესაძლებლობების ბიოლოგიური ბენჩმარქი

OpenAI-მ GeneBench-Pro წარმოადგინა — 129 ამოცანისგან შემდგარი ბენჩმარქი, რომელიც ამოწმებს, შეუძლია თუ არა AI-ს გამოთვლითი ბიოლოგიის სფეროში კვლევითი განსჯის უნარი.

ვრცლად →

ByteDance-მ Doubao Seed 2.1 წარადგინა — ამბობს, GPT-5.5-ს agent-ურ ამოცანებში ეჯიბრება

ByteDance-მა 23 ივნისს Doubao Seed 2.1 Pro და Turbo გამოუშვა — კომპანია ამბობს, რომ ახალი მოდელები კოდირებისა და agent-ური ამოცანების ბენჩმარკებზე ლიდერობენ და GPT-5.5-ს ეჯიბრებიან.

ვრცლად →

Alibaba-ს ღია AI სამყაროს მოდელმა GPT-5.4 გადააჭარბა

Alibaba-ს Qwen-ის გუნდმა გამოაქვეყნა Qwen-AgentWorld — ღია კოდის ენობრივი სამყაროს მოდელების ოჯახი, რომელიც AI აგენტების ქმედებებზე ციფრული გარემოს რეაქციებს პროგნოზირებს. 397B-ის ვარიანტმა AgentWorldBench-ზე GPT-5.4 გადააჭარბა.

ვრცლად →