Zhipu AI-მ, პეკინში დაფუძნებულმა ლაბორატორიამ GLM მოდელების ოჯახის შემქმნელმა, 14 აგვისტოს გამოუშვა GLM-5.3 — ივნისის GLM-5.2-ის კოდირებაზე ორიენტირებული განახლება. კომპანიის საკუთარი განცხადებით, ყველაზე მნიშვნელოვანი სიახლე სულ სხვა რამეა: მოდელმა მოულოდნელად კარგად ისწავლა პროგრამული ხარვეზების პოვნა და გამოყენება.
კოდირების გაუმჯობესება მხოლოდ დამატებითი წვრთნით
Zhipu-ს განცხადებით, GLM-5.3-ის ყველა შესაძლებლობის ზრდა იმავე საბაზისო მოდელზე გახანგრძლივებული განმტკიცებითი წვრთნის შედეგია — არქიტექტურა უცვლელი დარჩა. კომპანია აცხადებს, რომ საკუთარ შიდა კოდირების ბენჩმარკზე გაუმჯობესებამ 50%-ს მიაღწია, ხოლო Terminal-Bench 3.0-ზე ქულა 4.6-დან 28.3-მდე, DeepSWE v1.1-ზე კი 46.2-დან 66.9-მდე გაიზარდა — ორივე შემთხვევაში ეს ღია წონების მოდელებს შორის საუკეთესო შედეგია და, Zhipu-ს თქმით, კოდირებაში Anthropic-ის წამყვან მოდელ Claude Fable 5-ს უახლოვდება.
მოულოდნელი ნახტომი კიბერშესაძლებლობებში
იმავე დამატებითმა წვრთნამ კიბერშეტევის უნარებში მოსალოდნელზე მკვეთრი ზრდა გამოიწვია. GLM-5.3-ის ქულა CyberGym ბენჩმარკზე 77.2%-დან 84.5%-მდე გაიზარდა — ეს აღემატება Anthropic-ის Mythos 5-ის (83.8%) და OpenAI-ის GPT-5.6 Sol-ის (83.6%) შედეგებს, თუმცა უფრო რთულ ExploitBench ტესტში ორივეს კვლავ ჩამორჩება, მიუხედავად იმისა, რომ საკუთარი ქულა თითქმის გასამმაგდა — 24.4%-დან 54.4%-მდე.
გარე უსაფრთხოების მკვლევრებთან ერთად ჩატარებულმა რეალურმა ტესტირებამ, Zhipu-ს თქმით, 269 ღია კოდის პროექტში 2,436 ხარვეზი გამოავლინა, მათ შორის 1,097 საშუალო ან მაღალი სიმძიმის. ყველაზე ძველი ხარვეზი 1981 წლიდან იღებდა სათავეს, საშუალოდ კი ხარვეზები 26.6 წელი რჩებოდა შეუმჩნეველი. 53 შემთხვევა უკვე საჯაროდაა გამჟღავნებული, დანარჩენები კი ემბარგოშია, სანამ Zhipu ახალი სისტემის — Security Disclosure Ledger-ის — მეშვეობით პროექტების მხარდამჭერებთან ერთად შესწორებებზე მუშაობს.
წონები დროებით შეიკავეს — „განმტკიცებამდე“
GLM-5.3 უკვე ხელმისაწვდომია Zhipu-ს GLM Coding Plan-სა და API-ის მეშვეობით და მუშაობს ისეთ კოდირების აგენტებთან, როგორიცაა Claude Code და OpenCode. თუმცა, კომპანიის წინა გამოშვებების უმეტესობისგან განსხვავებით, ღია წონების ვერსია დაუყოვნებლივ არ გამოქვეყნდება — Zhipu-ს განცხადებით, საჭიროა დაახლოებით ორი კვირა „უსაფრთხოების შეფასებისა და განმტკიცებისთვის“. კომპანიამ განაცხადა: „კიბერშესაძლებლობა მოსალოდნელზე უფრო სწრაფად განვითარდა“, და დასძინა, რომ შესაძლებლობა „ყველაზე სწრაფად სწორედ იქ იზრდება, სადაც დასავლურ ლაბორატორიებთან შედარებით ყველაზე მეტად ჩამორჩებით“.
ეს დაგვიანება Zhipu-ს OpenAI-სა და Anthropic-ის გვერდით აყენებს — ორივემ ცოტა ხნის წინ გაამკაცრა შემოწმება საკუთარი უახლესი მოდელებისთვის მას შემდეგ, რაც მათ შიდა კიბერუსაფრთხოების ზღვარი გადალახეს. თუმცა GLM-5.3 იმითაც გამოირჩევა, რომ ის ღია წონების მოდელია — გამოქვეყნების შემდეგ მის წონებს ნებისმიერი ჩამოტვირთავს და გაუშვებს, Zhipu-ს საკუთარი დაცვის მექანიზმების გარეშე.