ახალი საეტალონო ტესტი მიანიშნებს, რომ დღევანდელ ყველაზე მოწინავე დიდ ენობრივ მოდელებსაც კი უჭირთ სამეცნიერო ნაშრომის ძირითადი იდეის აღდგენა მხოლოდ მასში მოხსენიებული წყაროების სიის მიხედვით — ეს ტესტი ამოწმებს პრეტენზიებს, თითქოს AI-ს რეალურად შეუძლია სამეცნიერო კვლევაში დახმარება.
ტესტის, სახელად Reconstruction, ავტორები მოდელს არ აძლევენ არც თავად ნაშრომს და არც მასთან ერთდროულად თუ მოგვიანებით გამოქვეყნებულ ლიტერატურას — ისე, რომ მოდელს ეს ნაშრომი წვრთნისას წაკითხული არ ჰქონდეს. წყაროების სია ანონიმურია და გაყინულია იმ მდგომარეობაში, რაც გამოქვეყნებამდე იყო ხელმისაწვდომი; შემდეგ მოდელს სთხოვენ, მხოლოდ ამ სიის საფუძველზე გამოიცნოს ნაშრომის რეალური წვლილი. დამოუკიდებელი AI „მსაჯი“ ამოწმებს, ემთხვევა თუ არა ვარაუდი ნამდვილ იდეას.
გუნდმა ეს საეტალონო ტესტი 643 ნაშრომზე ჩაატარა ექვს დარგში: მანქანურ სწავლებაში, ასტრონომიაში, ქიმიაში, მასალათმცოდნეობაში, მედიცინასა და ფიზიკაში.
წამყვანმა მოდელებმა ვერ გაართვეს თავი
ცალ-ცალკე შემოწმდა შვიდი წამყვანი მოდელი: Claude Opus 4.8, GPT-5.6 Sol Pro, Kimi K3, GLM 5.2, Gemini 3.1 Pro Preview, DeepSeek-V4-Pro და Qwen3.7-Max. არცერთმა აჩვენა კარგი შედეგი — დარგის მიხედვით სისწორის მაჩვენებელი 3-დან 15 პროცენტამდე მერყეობდა, საუკეთესო საშუალო შედეგი კი, 13.3%, Claude Opus 4.8-მა აჩვენა, ნაშრომის თანახმად.
მოდელების გაერთიანებამ შედეგი მნიშვნელოვნად გააუმჯობესა. სისტემამ, სადაც რამდენიმე მოდელი ერთმანეთის ვარაუდებს ჯვარედინად აფასებდა და შემდეგ საუკეთესო ოთხს შორის ტურნირის ფორმატში ირჩევდა, დარგის მიხედვით 22.9-დან 41.6 პროცენტამდე შედეგი აჩვენა — საშუალოდ 36%, რაც საუკეთესო ცალკეულ მოდელზე დაახლოებით 2.4-ჯერ მაღალია.
რატომ აქვს ამას მნიშვნელობა
შედეგები იმ დროს ქვეყნდება, როცა AI ლაბორატორიები საკუთარ მოდელებს სულ უფრო ხშირად კვლევის თანაშემწეებად წარმოაჩენენ. OpenAI-მ ცოტა ხნის წინ განაცხადა, რომ მისმა გამოუქვეყნებელმა Astra მოდელმა ათი მანამდე ამოუხსნელი მათემატიკური ამოცანა ამოხსნა, ხოლო Anthropic-ის Claude Fable 5-მა წელს დაეხმარა 87 წლის მათემატიკური ჰიპოთეზის უარყოფაში. Reconstruction კი მიანიშნებს, რომ სხვა, გაცილებით რთული უნარი — ჯერ არავის დაფიქსირებული იდეის მხოლოდ კონტექსტიდან გამოცნობა — ცალკეული მოდელისთვის დღემდე თითქმის მიუწვდომელია.
ავტორები Reconstruction-ს უფრო დიდი პროექტის, „AI-Professor“-ის ნაწილად აღწერენ — ეს ტესტი ლიტერატურის გააზრების შემოწმებაა, სანამ ისინი გადავლენ გაცილებით რთულ „გენერაციის რეჟიმზე“, რომლის მიზანიც არა არსებული იდეების აღდგენა, არამედ ახლის შეთავაზება იქნება. ამჟამად კი უფსკრული არსებულის აღდგენასა და ორიგინალურის შექმნას შორის დიდია — საუკეთესო მრავალმოდელიანი სისტემებისთვისაც კი.