ლონდონში დაფუძნებული AI ლაბორატორია Inherent Labs აცხადებს, რომ მისმა 27-მილიარდპარამეტრიანმა აგენტმა, სახელად Faraday-მ, აჯობა Anthropic-ის Claude Opus 4.8-სა და OpenAI-ის GPT-5.5-ს ამოცანაში, რომელშიც იშვიათად ტესტავენ AI სისტემებს — გამოქვეყნებული სამეცნიერო ნაშრომების შედეგების რეპროდუცირებაში.

რეპროდუცირება, არა მხოლოდ პროგნოზირება

Faraday შეაფასეს Replica-ზე — Inherent Labs-ის მიერ საკუთარი ძალებით შექმნილ ბენჩმარკზე. ის მოითხოვს, რომ AI აგენტმა აღადგინოს კონკრეტული გრაფიკი კვლევითი ნაშრომიდან, შეზღუდული დროისა და გამოთვლითი რესურსის პირობებში, ორიგინალი გრაფიკის ნახვის გარეშე. საწყისი ნაკრები მოიცავს 310 დავალებას 100 ნაშრომიდან, მათ შორის ბუნებრივი ენის დამუშავების, მასალათმცოდნეობისა და ამინდის პროგნოზირების სფეროებში.

Inherent-ის საკუთარი ანგარიშის მიხედვით, Faraday-მ უფრო ერთგული რეპროდუქციები შექმნა Claude Opus 4.8-სა და GPT-5.5-თან შედარებით ნაშრომის ყველა კატეგორიაში, მიუხედავად იმისა, რომ გაცილებით მცირე საბაზისო მოდელზე მუშაობდა — Alibaba-ს ღია წონების Qwen 3.6-ზე, 27 მილიარდი პარამეტრით. Faraday ასევე იყენებს GPT-5.5 Codex-ს, როგორც კოდირების ხელსაწყოს თავისი მუშაობის დროს, რაც ნიშნავს, რომ გაცილებით პატარა, მმართველ როლში მყოფმა მოდელმა აჯობა იმ უფრო დიდ სისტემას, რომელსაც ნაწილობრივ ეყრდნობა კიდეც.

როგორ გაწვრთნეს

კომპანიის თქმით, Faraday გაწვრთნეს გრძელვადიანი განმტკიცების სწავლებით (reinforcement learning) — გამოიყენეს თითოეული დავალებისთვის ცალკე შეფასების კრიტერიუმები, რათა შემცირებულიყო ჯილდოს სიგნალის ხმაური, აგრეთვე მრავალნიმუშიანი აგრეგირება და სვლა-სვლაზე კრედიტის მინიჭება, ხოლო შემფასებელი LLM ადამიანურ შეფასებებთან შედარებით ვალიდირდა. მთავარმა მეცნიერმა ედვარდ ჰიუზმა, Google DeepMind-ის ყოფილმა თანამშრომელმა, TechCrunch-თან საუბარში აღნიშნა, რომ უფრო საინტერესო თავად წვრთნის მეთოდი იყო, ვიდრე უფრო დიდ მოდელებთან პირისპირ გამარჯვება.

Inherent Labs, რომელიც რამდენიმე ყოფილმა DeepMind-ის მკვლევარმა დააფუძნა, სტელს რეჟიმიდან 2026 წლის მაისში გამოვიდა $50 მილიონიანი სათესლე რაუნდით. კომპანიას დაახლოებით ათეული თანამშრომელი ჰყავს და გეგმავს, წლის ბოლომდე გუნდი 20–25 თანამშრომლამდე გაზარდოს.

წარმატების ვიწრო ფარგლები

მკვლევრები ფრთხილად აღნიშნავენ შედეგის შეზღუდვებს. საკუთარ ანგარიშში ისინი წერენ, რომ „გრაფიკის სრულყოფილი აღდგენა სულაც არ ნიშნავს წარმატებულ რეპროდუცირებას" — ნამდვილი სამეცნიერო რეპროდუცირება მოითხოვს ასევე ექსპერიმენტის სწორ დიზაინს, ორიგინალი მტკიცებების ერთგულებას და რესურსების გონივრულ გამოყენებას, რასაც Replica ბენჩმარკი სრულად ვერ ზომავს. Faraday-ს შედეგების დამოუკიდებელი, მესამე მხარის გადამოწმება ჯერ არ გამოქვეყნებულა.

ეს შედეგი ავსებს არაერთგვაროვან სურათს იმის შესახებ, თუ როგორ ართმევენ თავს AI სისტემები რეალურ სამეცნიერო სამუშაოს: ადრინდელმა კვლევამ აჩვენა, რომ დღევანდელი მოდელები კვლევის ახალი იდეების მხოლოდ 3–15%-ს აღადგენენ, როცა მათ განზე დატოვებულ ნაშრომებზე ამოწმებენ — რაც მიანიშნებს, რომ ნამდვილი სამეცნიერო მსჯელობა ჯერ კიდევ შორსაა გადაწყვეტისგან, მიუხედავად იმისა, რომ უფრო ვიწრო რეპროდუცირების ამოცანები უმჯობესდება.

ასევე წაიკითხეთ