Code Arena ცოცხალი შეფასების პლატფორმაა, რომელიც AI მოდელებს არა ტესტ-კითხვების ფიქსირებულ ნაკრებზე აფასებს, არამედ უყურებს, როგორ ქმნიან ისინი რეალურ პროგრამულ პროდუქტს. ორი ანონიმური მოდელი იღებს ერთსა და იმავე ღია დავალებას, ქმნის მომუშავე აპლიკაციას იზოლირებულ გარემოში, ხოლო შემფასებელი ადამიანი ირჩევს, რომელმა გააკეთა უკეთესი სამუშაო. ეს ხმები გროვდება მუდმივად განახლებად რეიტინგში, რომელიც დღეს ერთ-ერთი ყველაზე ყურადღებით დაკვირვებადი ინდიკატორია იმისა, თუ რომელი დიდი ენობრივი მოდელები ნამდვილად კარგები არიან პროგრამული უზრუნველყოფის შექმნაში — და არა მხოლოდ მასზე საუბარში.
როგორ მიმდინარეობს შეფასება
თითოეული რაუნდი იწყება დავალებით — მაგალითად, «შექმენი ხარჯების ტრეკერი გრაფიკებით». ორივე მოდელი მოქმედებს როგორც აგენტი: ჯერ გეგმავს დავალებას, შემდეგ იყენებს სტრუქტურირებულ ხელსაწყოების გამოძახებებს, როგორიცაა create_file, edit_file და run_command, რათა ეტაპობრივად დაწეროს, გაუშვას და შეასწოროს კოდი — ზუსტად ისე, როგორც დეველოპერი იმუშავებდა რედაქტორსა და ტერმინალში. ყველა მოქმედება ფიქსირდება ჟურნალში და სესია მისი დასრულების შემდეგაც შესამოწმებელი რჩება, ასე რომ შემფასებელს შეუძლია ნახოს არა მხოლოდ საბოლოო აპლიკაცია, არამედ ის, თუ როგორ მივიდა მოდელი ამ შედეგამდე.
როდესაც ორივე მოდელი ამთავრებს, ადამიანი შემფასებელი ადარებს ორივე ნაშენს გვერდიგვერდ და აფასებს სამ კრიტერიუმს: მართლა მუშაობს თუ არა აპლიკაცია, რამდენად სასიამოვნოა მისი გამოყენება და რამდენად ზუსტად შეესაბამება თხოვნას. ეს წყვილური ხმები საბოლოოდ კვებავს ელო რეიტინგის სისტემას — იმავე ტიპის ფორმულას, რომელსაც ჭადრაკში მოთამაშეთა შესაფასებლად იყენებენ — რომელიც ათასობით ორმხრივ მოგება-წაგებას ერთ შედარებით ქულად აქცევს. რადგან ცალკეული ქულა თავისთავად მხოლოდ შეფასებაა, რეიტინგში თითოეული მოდელის პოზიციასთან ერთად ჩანს ცდომილების ინტერვალიც — რაც აჩვენებს, რომ რეიტინგი არ არის აბსოლუტურად ზუსტი რიცხვი.
Chatbot Arena-დან Code Arena-მდე
ეს ფორმატი Chatbot Arena-დან იღებს სათავეს — ბრმა, გვერდიგვერდულ კენჭისყრაზე დაფუძნებული პლატფორმიდან, რომელიც LMArena-მ — დღეს უბრალოდ Arena-მ — 2023 წელს შექმნა ზოგადი, სასაუბრო პასუხების შესაფასებლად. როცა AI ლაბორატორიები გადაერთნენ აგენტურ კოდირების ხელსაწყოებზე, რომლებიც გეგმავენ, იყენებენ ხელსაწყოებს და ეტაპობრივად მოქმედებენ — უბრალო ფუნქციის დასრულების ნაცვლად — იმავე გუნდმა შექმნა კოდირებისთვის სპეციალური ვერსია, თავდაპირველად WebDev Arena-ს სახელით, შემდეგ კი, უფრო ფართო განახლების შემდეგ — Code Arena-დ. დღეს ის მოიცავს სრულფასოვან, ფულ-სტეკ დავალებებსაც — მონაცემთა ბაზებს, ავთენტიფიკაციას, მესამე მხარის ინტეგრაციებს — და არა მხოლოდ ფრონტ-ენდის პროტოტიპებს.
რატომ აქვს მნიშვნელობა
კოდირების ძველი ტიპის ბენჩმარკები ძირითადად ამოწმებდნენ, გადის თუ არა გენერირებული კოდი ტესტების ფიქსირებულ ნაკრებს. ეს მიდგომა მოდელს აჯილდოებს ცნობილი ამოცანების ამოცნობისთვის, მაგრამ ცოტას ამბობს რეალურ, ბუნდოვან სამუშაოზე — ბუნდოვანი მოთხოვნის მომუშავე პროდუქტად გადაქცევაზე, შეცდომიდან გამოსწორებაზე ან გზაში გონივრული დიზაინის არჩევანის გაკეთებაზე. Code Arena-ს აგენტური, ადამიანების მიერ შეფასებული ფორმატი სწორედ ამის გაზომვის მცდელობაა, და მისი შედეგები დღეს გავლენას ახდენს იმაზე, თუ რომელ მოდელს ირჩევენ დეველოპერები და კომპანიები საკუთარი პროდუქტების ასაშენებლად — იგივე როლი, რომელსაც AI ბენჩმარკები დიდი ხანია თამაშობენ, უბრალოდ გამოყენებული ბევრად უფრო რთულ და ღია დავალებაზე.
ეს არ არის მოდელის პირადად გამოცდის სრულყოფილი შემცვლელი. მოდელის Code Arena-ს რეიტინგი ასახავს დავალების ერთ კონკრეტულ ტიპს — დამოუკიდებელი აპლიკაციის ნულიდან აშენებას — და შეიძლება მკვეთრად განსხვავდებოდეს იმისგან, თუ როგორ მუშაობს იგივე მოდელი არსებული კოდის გამართვისას, ინფრასტრუქტურული კოდის წერისას ან ჩვეულებრივ საუბარში. რეიტინგები სწრაფად იცვლება ლაბორატორიების მიერ განახლებული მოდელების გამოშვებასთან ერთად, ხოლო ადამიან შემფასებელთა ჯგუფსაც, თუნდაც ის დიდი იყოს, მაინც აქვს საკუთარი მიკერძოებები იმის შესახებ, თუ რა გამოიყურება «მოწესრიგებულად». რეიტინგს უმჯობესია მოეპყროთ როგორც სასარგებლო, მუდმივად ცვალებად სიგნალს და არა საბოლოო განაჩენს.
ვისაც სურს თავად ნახოს, როგორ მუშაობს ეს ყველაფერი, შეუძლია დაათვალიეროს ცოცხალი რეიტინგი — და თავადაც მისცეს ხმა — Code Arena-ს WebDev რეიტინგზე.
სიახლეებში
Code Arena-ს რეიტინგი იმდენად ხშირად იცვლება, რომ თავადაც სიახლედ იქცევა ხოლმე: Alibaba-ს Qwen მოდელმა ცოტა ხნის წინ სათავეში ჩაუდგა Code Arena-ს რეიტინგს და გაუსწრო Claude Opus 5-ს — შეხსენება იმისა, თუ რამდენად სწრაფად იცვლის ლიდერი ადგილს, როცა ლაბორატორიები ახალ ვერსიებს უშვებენ.