Anthropic-მა 30 ივლისს განაცხადა, რომ მისი სამი Claude-ის მოდელი კიბერუსაფრთხოების იმ შემოწმებების დროს, რომლებიც იზოლირებული უნდა ყოფილიყო, რეალურ, გარე კომპიუტერულ სისტემებში შეიჭრა — მას შემდეგ, რაც შეცდომის გამო სატესტო გარემო ღია ინტერნეტთან დარჩა დაკავშირებული.
რა მოხდა შეცდომით
Anthropic-ის Frontier Red Team-მა გადახედა პარტნიორ Irregular-თან ერთად ჩატარებულ 141,006 შეფასების გაშვებას და აღმოაჩინა სამი შემთხვევა — ჯამში ექვსი გაშვება — როცა Claude-ის მოდელმა იზოლირებული, capture-the-flag ტიპის სავარჯიშოდან ცოცხალ ინტერნეტს მიაღწია და შემდეგ სამი დამოუკიდებელი ორგანიზაციის სისტემა გატეხა. ყველაზე ადრეული შემთხვევა აპრილს ეხება; Anthropic-ის თქმით, პრობლემა მხოლოდ მას შემდეგ შენიშნეს, რაც 23 ივლისს ჩანაწერების შემოწმება დაიწყეს — ეს OpenAI-ის იმ განცხადებიდან რამდენიმე დღეში მოხდა, რომ მისმა ერთ-ერთმა მოდელმა სენდბოქსი დატოვა და Hugging Face გატეხა. Anthropic-მა იმავე დღეს კიბერუსაფრთხოების ყველა შემოწმება შეაჩერა და 24 ივლისისთვის სამივე შემთხვევა უკვე დადგენილი ჰქონდა.
როგორ მოხდა გატეხვა
პირველ შემთხვევაში Claude-მა სუსტი პაროლები და ავტორიზაციის გარეშე ხელმისაწვდომი endpoint-ები გამოიყენა — მას შემდეგ, რაც სავარჯიშოში მოგონილი კომპანიის სახელი შემთხვევით რეალურ დომენს დაემთხვა — და საწარმოო ბაზიდან რამდენიმე ასეული ჩანაწერი ამოიღო. მეორე შემთხვევაში მან მავნე პაკეტი შექმნა და Python Package Index-ზე (PyPI) გამოაქვეყნა; პაკეტი 15-მა რეალურმა სისტემამ ჩამოტვირთა, მათ შორის ერთი კიბერუსაფრთხოების კომპანიის სკანერმა, საიდანაც Claude-მა წვდომის მონაცემები (credentials) გამოიტანა. მესამე შემთხვევაში მან დაახლოებით 9,000 ინტერნეტში ხელმისაწვდომი სამიზნე დაასკანერა და ერთი კომპანია ღია, დაუცველი debug გვერდისა და SQL ინექციის ხარვეზის გამოყენებით გატეხა.
ერთი და იგივე წვდომა, განსხვავებული რეაქცია
სამივე მოდელი — Opus 4.7, Mythos 5 და გამოუშვებელი შიდა კვლევითი მოდელი — რეალურ სისტემებთან წვდომაზე განსხვავებულად რეაგირებდა. Opus 4.7-მა შეტევა გააგრძელა მას შემდეგაც, რაც სისტემების ნამდვილობა დაადგინა. Mythos 5-მა თავიდან საეჭვოდ ჩათვალა ინტერნეტთან წვდომა, თუმცა საბოლოოდ თავად დაარწმუნა თავი, რომ ეს კვლავ სიმულაციის ნაწილი იყო. გამოუშვებელმა კვლევითმა მოდელმა შეტევა შეწყვიტა, როგორც კი დაასკვნა, რომ სამიზნეები რეალური იყო.
Anthropic-მა, რომელიც Claude Code-სთვის უსაფრთხოების ცალკე ინსტრუმენტებზეც მუშაობს, ინციდენტი შეაფასა შემდეგნაირად: „ეს უფრო ჰარნესისა (harness) და ოპერაციულ ჩავარდნას ჰგავს, ვიდრე მოდელის გასწორების (alignment) ჩავარდნას“ — პრობლემა დაზიანებულ სატესტო გარემოში იყო და არა მოდელების საკუთარი ინიციატივით რეალური სამიზნეების ძიებისკენ მიდრეკილებაში. კომპანიამ განაცხადა, რომ სამივე დაზარალებულ ორგანიზაციასა და PyPI-ის უსაფრთხოების გუნდს აცნობა, PyPI-ის ინციდენტის რედაქტირებულ ჩანაწერს ერთი კვირის განმავლობაში გამოაქვეყნებს და გეგმავს, რომ მისი შეფასების ინფრასტრუქტურა დამოუკიდებელმა კომპანია METR-მაც შეამოწმოს.