Anthropic-მა შეცვალა უსაფრთხოების კლასიფიკატორი, რომელიც Claude Fable 5-ზე, კომპანიის წამყვან მოდელზე, ბიოლოგიასთან დაკავშირებულ კითხვებს ამოწმებს — 7 აგვისტოს განცხადებით, ჩვეულებრივი ბიოლოგიური კითხვების არასწორად უფრო სუსტ მოდელზე გადამისამართების წილი დაახლოებით 85%-ით შემცირდა.

რა შეიცვალა

კლასიფიკატორი ზედმეტად ფრთხილად იყო მორგებული და ხშირად აგზავნიდა ჩვეულებრივ კითხვებს — ლაბორატორიული ანალიზების ინტერპრეტაციას, სიმპტომების გარკვევას თუ სასკოლო ბიოლოგიის საკითხებს — სუსტ მოდელზე, Opus 5-ზე, უბრალოდ იმის გამო, რომ კითხვა ბიოლოგიას ეხებოდა. Anthropic-ის თქმით, ინჟინრებმა თავიდან დაწერეს კლასიფიკატორის „კონსტიტუცია“ — წესების ნაკრები, რომელიც განსაზღვრავს, რა უნდა მოინიშნოს — მოისმინეს შიდა და გარე ექსპერტების მოსაზრებები, შექმნეს ახალი სავარჯიშო მონაცემები და თავიდან გაწვრთნეს სისტემა ისე, რომ ნამდვილად სარისკო მოთხოვნები კვლავ იბლოკებოდეს, ხოლო ჩვეულებრივი — თავისუფლდებოდეს.

Anthropic-ის მონაცემებით, გადამისამართების მაჩვენებელი დაახლოებით 67%-ით შემცირდა Claude.ai-ზე, 55%-ით — Cowork-ში, 17%-ით — Claude Code-ში და 7%-ით — Claude-ის დეველოპერულ პლატფორმაზე. კომპანიის განცხადებით, სამედიცინო პერსონალიც ნაკლებ შეფერხებას იგრძნობს რუტინულ კლინიკურ ამოცანებში.

რა რჩება შეზღუდული

ცვლილება მხოლოდ მცდარ დადებით შედეგებს ამცირებს და არ ცვლის ძირითად პოლიტიკას. Fable 5 კვლავ უარს ამბობს ორმაგი დანიშნულების პროფესიულ კვლევებთან, ვირუსოლოგიასთან, ტოქსიკოლოგიასთან და მოლეკულურ დიზაინთან დაკავშირებულ მოთხოვნებზე — კატეგორიები, რომლებსაც Anthropic რეალურ ბიოუსაფრთხოების რისკად მიიჩნევს. კომპანიის თქმით, ბიოლოგია და მედიცინა AI-ის ერთ-ერთი ყველაზე დიდი პოტენციური სარგებელია, თუმცა იგივე შესაძლებლობები ორმაგი დანიშნულების პრობლემასაც წარმოშობს, რაც სრული აკრძალვის ნაცვლად ფრთხილ კონტროლს მოითხოვს.

რატომ ახლა

ცვლილება AI უსაფრთხოების კლასიფიკატორების ირგვლივ გამწვავებული ყურადღების ფონზე ხდება — ლაბორატორიები კრიტიკის ობიექტი ხდებიან იმის გამოც, რომ უვნებელ კითხვებს ზედმეტად ბლოკავენ, და იმის გამოც, რომ ზოგჯერ საშიშ მოთხოვნებსაც ატარებენ. ეს ცვლილება Anthropic-ის საკუთარ მეთოდს, კონსტიტუციურ AI-ს ეყრდნობა, რომელიც კლასიფიკატორებს წერილობითი წესების ნაკრების მიხედვით ავარჯიშებს და მართავს, და არა მხოლოდ ადამიანის შეფასებაზე დაყრდნობით.

Anthropic-მა არ დააკონკრეტა, როდის გავრცელდება განახლებული კლასიფიკატორი Claude-ის სხვა მოდელებზეც.