პარიზში დაფუძნებულმა ღია წონების AI ლაბორატორიამ Mistral AI-მ 4 აგვისტოს გამოუშვა Shieldstral — 3-მილიარდპარამეტრიანი მოდელი კონტენტის მოდერაციისთვის, რომელიც ტექსტსა და სურათებს ამოწმებს არა ჩაშენებული, ფიქსირებული წესების, არამედ თავისუფალი ენით ჩამოყალიბებული პოლიტიკის მიხედვით.
როგორ მუშაობს
უმეტეს დამცავ მოდელს აკრძალული კონტენტის ფიქსირებული ჩამონათვალი საკუთარ წონებში აქვს ჩაშენებული, ამიტომ ახალი წესის დასაწესებლად ხელახალი წვრთნა სჭირდება. Shieldstral კი გამოთვლის დროს სამ შემავალ მონაცემს იღებს: ინსტრუქციას (შეფასების კონტექსტი და სიმკაცრის ხარისხი), დიახ/არა ტიპის კითხვას და თავად შესამოწმებელ კონტენტს — ტექსტს, სურათს ან ორივეს ერთად. შედეგად ის აბრუნებს არა უბრალო იარლიყს, არამედ ალბათობის კალიბრირებულ მაჩვენებელს, რაც დეველოპერებს თავად აძლევს ზღვრის დაწესების საშუალებას. Mistral-ის განცხადებით, ეს მიდგომა საშუალებას აძლევს ერთ მოდელს ერთდროულად რამდენიმე განსხვავებულ პოლიტიკას მოემსახუროს — ხელახალი წვრთნის გარეშე — და მოდელი მუშაობს ერთადერთ, 16 გბ მეხსიერების Nvidia GPU-ზეც კი.
შედეგები ტესტებში
Mistral-ის თანახმად, Shieldstral აღემატება ან უტოლდება ღია დამცავ მოდელებს, რომლებიც მასზე შვიდჯერამდე დიდია — ტექსტის უსაფრთხოების, უარის აღმოჩენის, პოლიტიკასთან ადაპტაციისა და მულტიმოდალური უსაფრთხოების ტესტებში, რომლებიც კომპანიამ დამოუკიდებელ სატესტო მონაცემებზე ჩაატარა. Hugging Face-ზე გამოქვეყნებული მოდელის ბარათის მიხედვით, Shieldstral 12 ენას მხარს უჭერს და გავრცელებულია Apache 2.0-ის ლიცენზიით — ანუ უფასოა როგორც კომერციული, ისე არაკომერციული გამოყენებისთვის.
უფრო ფართო უსაფრთხოების ინიციატივის ნაწილი
Shieldstral ერთ-ერთი პირველი კონკრეტული პროდუქტია, რომელიც უკავშირდება Open Secure AI Alliance-ს — Nvidia-ს ინიციატივით შექმნილ, 50-ზე მეტი კომპანიის (მათ შორის Mistral-ის, Microsoft-ისა და Cisco-ის) გაერთიანებას, რომელიც ივლისის ბოლოს დაარსდა AI მოდელებისა და აგენტების უსაფრთხოებისთვის საერთო, შემოწმებადი ხელსაწყოების შესაქმნელად. ალიანსის აქამდე გამოქვეყნებული შედეგები ძირითადად სახელმძღვანელო პრინციპებსა და ჩარჩოებს მოიცავდა — Shieldstral კი უკვე მზა, დღესვე გადმოსაწერი მოდელია.
Mistral AI-სთვის, რომელმაც სახელი ღია წონების მოდელების გამოშვებით და არა დახურული API-ებით მოიხვეჭა, ეს გამოშვება ასევე მოდერაციის ხელსაწყოცაა, რომლის საკუთარ პროდუქტებში ჩართვაც ნებისმიერ დეველოპერს შეუძლია. ეს კიდევ ერთი მაგალითია იმისა, თუ როგორ განიხილავს ეს ლაბორატორია უსაფრთხოების ინფრასტრუქტურას, როგორც ღია პროდუქტს და არა შიდა, დახურულ სისტემას.