Anthropic-მა 2026 წლის 14 აგვისტოს გამოაქვეყნა კომპანიის მეორე, მთელ ორგანიზაციაზე გავრცელებული რისკის ანგარიში, რომელშიც პირველად გაამჟღავნა შიდა, გამოუშვებელი მოდელი Model 2 — ის საჯარო წამყვან მოდელს, Claude Mythos 5-ს, შესაძლებლობებით ოდნავ აღემატება. ანგარიშში Anthropic-მა ასევე გაზარდა საკუთარი შეფასება იმისა, თუ რამდენად საშიშია AI-ის არასწორი ალაინმენტი კატასტროფული შედეგების თვალსაზრისით — „ძალიან დაბლიდან“ „დაბალზე“.

მხოლოდ შიდა გამოყენების მოდელი

Model 2 საჯაროდ არ გამოშვებულა და, Anthropic-ის თქმით, ამჟამად ამის გეგმაც არ არსებობს. კომპანიის მკვლევრები მას შიდა სამუშაოებისთვის იყენებენ — კოდის დაწერა, სავარჯიშო მონაცემების გენერირება და საინჟინრო ამოცანების ავტომატიზაცია. ანგარიშის მიხედვით, Model 2 შესამჩნევად სჯობს Mythos 5-ს ამ ამოცანებში, თუმცა ეს ნახტომი გაცილებით მცირეა, ვიდრე წინა თაობებიდან Mythos-ის საწყის ვერსიაზე გადასვლისას დაფიქსირებული ზრდა. Anthropic-ის განმარტებით, მოდელს ჯერ არ გაუვლია სრული წინასწარი შემოწმებების ციკლი — მათ შორის უსაფრთხოებისა და შესაძლებლობების შეფასებები — რომელიც Mythos 5-მა და Claude Opus 5-მა საჯარო გამოშვებამდე გაიარეს, და ეს ერთ-ერთი მიზეზია, რის გამოც კომპანია მას ჯერჯერობით არ აქვეყნებს.

რატომ შეიცვალა რისკის შეფასება

Anthropic-ის პასუხისმგებლიანი მასშტაბირების პოლიტიკის მიხედვით, არასწორი ალაინმენტით გამოწვეული კატასტროფის რისკი „დაბალზე“ გაიზარდა 2026 წლის თებერვლის პირველ ანგარიშში მითითებული „ძალიან დაბალი“ შეფასებიდან. კომპანია ხაზს უსვამს, რომ ეს ცვლილება ახალი აღმოჩენა კი არ არის, არამედ განუსაზღვრელობის კორექტირებაა — ძირითადად იმის გამო, რომ ცოტა ხნის წინ გამჟღავნდა დეტალები კიბერინციდენტების შესახებ, რომლებიც შიდა ტესტირებისას Claude-ის მოდელებთან იყო დაკავშირებული.

ხარვეზი ბიოლოგიური იარაღის საწინააღმდეგო დაცვაში

ანგარიშში ასევე აღნიშნულია, რომ Claude-ის მოდელებსა და ადამიანური უკუკავშირის კონტრაქტორებს შორის დაახლოებით 133 მილიონი დიალოგი — დაახლოებით 50,000 კონტრაქტორის მონაწილეობით, 2025 წლის მაისიდან 2026 წლის აპრილამდე პერიოდში — გატარდა იმ ბლოკირების კლასიფიკატორების გარეშე, რომლებსაც Anthropic სახიფათო ბიოლოგიური შინაარსის მოთხოვნების დასაჭერად იყენებს. კომპანიის თქმით, ხარვეზი უკვე გამოსწორებულია, შემოწმებამ ბოროტად გამოყენების კვალი ვერ აღმოაჩინა და არც ერთი მომხმარებელი დაზარალებულა. არაახალი, უკვე ცნობილი ტიპის იარაღების შექმნაში დახმარების რისკი კვლავ „დაბლად“ ფასდება, თუმცა შეფასება ოდნავ აიწია.

Anthropic-ის თქმით, ეს რისკის ანგარიში სერიის მეორეა, რომლის გამოქვეყნებასაც კომპანია ყოველ სამ-ექვს თვეში გეგმავს, და პირველია, სადაც შიდა, გამოუშვებელი მოდელიც ფორმალურად ფასდება საჯარო მოდელების გვერდით.