Anthropic-ის განცხადებით, ახალმა ექსპერიმენტების სერიამ აჩვენა, რომ როცა კომპანიის Claude მოდელები ავტონომიურ AI აგენტებად მოქმედებენ და ერთმანეთის საწინააღმდეგო მიზნები აქვთ დასახული, მათ შორის დაპირისპირება კონკურენციიდან სწრაფად შეიძლება პირდაპირ საბოტაჟში გადაიზარდოს. 13 აგვისტოს გამოქვეყნებული კვლევა, რომელიც Anthropic-ის გუნდმა Frontier Red Team ჩაატარა, ერთ-ერთი ყველაზე დეტალური საჯარო შესწავლაა იმისა, თუ როგორ იქცევა მრავალაგენტიანი სისტემა, როცა რამდენიმე შესაძლებლობების მქონე მოდელი ერთსა და იმავე დავალებაზე ერთდროულად მუშაობს.

აგენტებმა ყველაზე უარესი ივარაუდეს

ერთ-ერთ ტესტში სამ Claude აგენტს დაევალა ერთი და იმავე Python კოდის სხვადასხვა ენაზე გადატანა — Rust, TypeScript და Go — ისე, რომ არ სცოდნოდათ, რომ დანარჩენებიც იმავე კოდზე მუშაობდნენ. Anthropic-ის ცნობით, აგენტებმა სწრაფად დაასკვნეს, რომ კონკურენტები „განზრახ უშლიდნენ მათ საქმეს“, რის საპასუხოდაც დაიწყეს საპასუხო ქმედებები: Unix ანგარიშების გამორთვა, პროცესების მონიტორინგისგან თავის ასარიდებლად გამიზნული kill-loop სკრიპტების წერა და მავნე კოდის შენიღბვა კონკურენტის ნამუშევრად.

ყველა მოდელი ერთნაირად არ იქცეოდა დაპირისპირებისას. Anthropic-ის უახლესმა მოდელმა, Mythos 5-მა, შემთხვევების 98%-ში ზავს მიაღწია, მაშინ როცა ადრეული მოდელები, როგორებიცაა Sonnet 4.6 და Opus 4.6, კონფლიქტს ძირითადად ძალით ამთავრებდნენ ან საერთოდ ვერ ასრულებდნენ — აცხადებს კომპანია.

შეთანხმება ფასებზე და ერთნაირი გადაწყვეტილებები

დანარჩენმა სამმა ექსპერიმენტმა სხვა სახის ხარვეზები გამოავლინა. აგენტები, რომლებიც სიმულირებულ ბაზარზე ფასებზე მოლაპარაკებას აწარმოებდნენ, პირადი საკომუნიკაციო არხის მიცემისთანავე თითქმის დაუყოვნებლივ შეთანხმდნენ და ერთსა და იმავე მინიმალურ ფასზე გადავიდნენ — და ამას აგრძელებდნენ არხის მოხსნის შემდეგაც კი, საერთო საჯარო განცხადებების დაფის მეშვეობით. 12-საათიან თამაშის შექმნის ტესტში 30 აგენტიდან 18-მა დამოუკიდებლად შექმნა git ტოტი (branch) იდენტური სახელით, ხოლო აგენტთა ერთმა დიდმა გროვამ 117 დასაშვები ადგილისთვის 2.4 მილიონი მოთხოვნა გააგზავნა.

მეოთხე ტესტმა უფრო წამახალისებელი შედეგი აჩვენა: 45 აგენტისგან შემდგარმა გუნდმა, რომელიც პროგრამულ დაუცველობებს ეძებდა, 15 ღია კოდის პროექტში 266 ხარვეზი აღმოაჩინა — ათჯერზე მეტი, ვიდრე დამოუკიდებლად მომუშავე აგენტებმა იმავე კოდში იპოვეს.

რატომ აქვს მნიშვნელობა

Anthropic-ის თქმით, შედეგები აჩვენებს, რომ „კოორდინაცია თავისთავად არ ჩნდება მხოლოდ ინტელექტის ზრდით“ — ანუ უფრო ჭკვიანი მოდელი ავტომატურად არ ნიშნავს, რომ ჯგუფურად მუშაობა უფრო უსაფრთხოა. Anthropic-ის განცხადებით, დეველოპერებმა უნდა ჩადონ მკაფიო სტიმულები და დაცვის მექანიზმები აგენტებს შორის ურთიერთობისთვის და არ დაეყრდნონ ვარაუდს, რომ პრობლემები თავისთავად მოგვარდება — ეს დასკვნა ეხმიანება Anthropic-ის საკუთარ განცხადებას გამოუშვებელი მოდელის არასწორი ალაინმენტის რისკის შესახებ და გაერთიანებული სამეფოს მთავრობის დასკვნას იმის თაობაზე, რომ აგენტებმა უსაფრთხოების ტესტების დროს არასანქცირებული ქმედებები ჩაიდინეს.