Anthropic-მა 24 ივლისს Claude Opus 5 გამოუშვა — საშუალო ფასის მოდელი, რომელიც, კომპანიის საკუთარი განცხადებით, წამყვან მოდელთან ჩამორჩენის დიდ ნაწილს ავსებს, ამასთან გაცილებით დაბალ ფასად მუშაობს.
რა შეიცვალა
Opus 5 ხდება ნაგულისხმევი მოდელი Claude Pro-სა და Claude Max-ში და ანაცვლებს Opus 4.8-ს, აცხადებს Anthropic. კომპანიის მონაცემებით, Opus 5 საკუთარ შიდა კოდირების ტესტში (Frontier-Bench) Opus 4.8-ის შედეგს თითქმის აორმაგებს, ხოლო CursorBench 3.2-ზე Claude Fable 5-ს მხოლოდ 0.5 პროცენტული პუნქტით ჩამორჩება — ორჯერ იაფად. მსჯელობის ტესტში (ARC-AGI 3) Opus 5-მა შედარებულ მოდელებს შორის საუკეთესოს სამჯერ აჯობა, აცხადებს კომპანია.
ფასი უცვლელი რჩება — $5 მილიონ შემავალ ტოკენზე და $25 მილიონ გამომავალ ტოკენზე, იგივე რაც Opus 4.8-ს ჰქონდა — და მოდელი თანდათან ხელმისაწვდომი ხდება Claude-ის API-ზე, Claude.ai-ზე, Claude Pro-ზე, Claude Max-ზე, Claude Code-სა და Claude Cowork-ში.
სად შეინიშნება ყველაზე დიდი ნახტომი
Anthropic-ის თქმით, ყველაზე დიდი გაუმჯობესება მეცნიერებასა და ფინანსებში შეინიშნება: Opus 5-მა ორგანული ქიმიის შეფასებებზე Opus 4.8-ს 10.2 პროცენტული პუნქტით აჯობა, ხოლო ცილებთან დაკავშირებულ ამოცანებში — 7.7 პუნქტით. ფინანსური მოდელირების სიზუსტე ინსტრუმენტების ნაკლები გამოძახებით 9 პუნქტით გაიზარდა. კომპანიის მიერ მოხმობილმა ადრეულმა მომხმარებლებმა — Devin-ის, Cursor-ისა და Zapier-ის საინჟინრო გუნდების ხელმძღვანელებმა — მოდელი აღწერეს როგორც ისეთი, რომელიც კოდირებასა და ავტომატიზაციაში Fable 5-ის დონესთან მიახლოებულ შედეგებს გაცილებით დაბალ ფასად აჩვენებს.
გამოშვება ასევე ორიენტირებულია ხანგრძლივად მომუშავე AI აგენტებზე: Anthropic-ის თქმით, Opus 5 ნაკლებ სხვაობას აჩვენებს გაშვებიდან გაშვებამდე და შეუძლია საკუთარი სამუშაოს გადამოწმება და დახვეწა დამოუკიდებლად — მაგალითად, კომპიუტერული ხედვის სპეციალური მილსადენის აწყობა ბოლომდე, ეტაპობრივი ხელმძღვანელობის გარეშე.
უსაფრთხოების შეზღუდვები ძალაში რჩება
Anthropic-ის განცხადებით, Opus 5, კომპანიის შიდა ქცევითი აუდიტების მიხედვით, დღემდე გამოშვებულთაგან ყველაზე მეტად გასწორებული მოდელია — მას წინა მოდელებთან შედარებით ნაკლები შემთხვევა აქვს მოტყუებითი ქცევისა. ის მაინც ჩამორჩება შეზღუდული წვდომის Claude Mythos 5-ს ბიოლოგიური კვლევისა და შეტევითი კიბერუსაფრთხოების ამოცანებში. კიბერუსაფრთხოების კლასიფიკატორები დაახლოებით 85%-ით ნაკლებად ერევიან მოდელის მუშაობაში, ვიდრე Fable 5-ის შემთხვევაში იყო — ისინი კვლავ ბლოკავენ ბინარულ სკანირებასა და ექსპლოიტების გენერაციას, თუმცა დეველოპერებს საშუალებას აძლევენ კოდის დაუცველობები აღმოაჩინონ. ბიოლოგიის ან კიბერუსაფრთხოების რისკზე მონიშნული მოთხოვნები ავტომატურად გადამისამართდება სხვა, უფრო შეზღუდულ მოდელზე, პირდაპირი პასუხის ნაცვლად.