AI უსაფრთხოების კლასიფიკატორი — რომელსაც «გარდრეილ» (guardrail) მოდელსაც უწოდებენ — არის პატარა, სპეციალურად შექმნილი AI მოდელი, რომლის ერთადერთი ამოცანაა, გადახედოს ტექსტს ან სურათს და გადაწყვიტოს, უსაფრთხოა თუ არა ის და, თუ არა — რომელ წესს არღვევს. ის თავად არაფერს წერს, მხოლოდ ნიშანს ანიჭებს. ჩატბოტის წინ განთავსებული, ის ამოწმებს, რას წერს მომხმარებელი, სანამ ეს მთავარ მოდელამდე მიაღწევს; ჩატბოტის მიღმა განთავსებული კი ამოწმებს, რას წერს მოდელი, სანამ პასუხი ვინმემდე მივა. ორივე შემთხვევაში ეს არის მეორე, ვიწროდ მიმართული AI, რომელიც დგას დიდი და უფრო შესაძლებლობებით მდიდარი მოდელის სადარაჯოზე.
როგორ მუშაობს გარდრეილ მოდელი
ჩვეულებრივი უსაფრთხოების კლასიფიკატორი სამ ელემენტს იღებს შესატანად: შესაფასებელ შინაარსს (მოთხოვნას, პასუხს, სურათს ან მოთხოვნა-პასუხის წყვილს), პოლიტიკას — შემოწმებად წესს, რომელიც ხშირად მარტივი კითხვის სახითაა ჩამოყალიბებული, მაგალითად «ხელს უწყობს თუ არა ეს შინაარსი ძალადობას?» — და სიმკაცრის დონეს. პასუხად ის გასცემს ვერდიქტს: ზოგჯერ მარტივ «უსაფრთხო» ან «საშიში» ნიშანს კატეგორიასთან ერთად, ზოგჯერ კი დაკალიბრებულ ქულას, რომელზეც ზღვარს მთლიანი სისტემა თავად ადგენს.
«პოლიტიკა როგორც კითხვა» — ეს მიდგომა საშუალებას აძლევს ერთ კლასიფიკატორს, ერთდროულად ბევრი წესი დაფაროს. იმის ნაცვლად, რომ საზიანო კატეგორიების ფიქსირებული ჩამონათვალი მოდელის წონებში იყოს ჩაშენებული — რაც ყოველი პოლიტიკის ცვლილებისას ხელახლა გადამზადებას მოითხოვდა — მოდელი ახალ წესებს იღებს, როგორც ბუნებრივ ენაზე დასმულ კითხვებს, ზუსტად მოთხოვნის მომენტში, გადამზადების გარეშე. სიახლეების პლატფორმას, ბავშვთა საგანმანათლებლო აპლიკაციას და კორპორატიულ მხარდაჭერის ბოტს — თითოეულს შეუძლია, საკუთარი სიმკაცრის დონე გამოიყენოს ერთსა და იმავე კლასიფიკატორზე.
უსაფრთხოების კლასიფიკატორები სულ უფრო ხშირად ტექსტის გარდა სხვასაც ამუშავებენ. Mistral AI-ის Shieldstral სურათებსაც ისევე ამუშავებს, როგორც ტექსტს — აფასებს ფოტოს წარწერასთან ერთად ან პასუხს, რომელიც სურათს აღწერს — რადგან ჩატბოტს, რომელსაც სურათების დანახვა და გენერირება შეუძლია, ისეთივე შესაძლებლობის ფილტრიც სჭირდება.
გარდრეილ მოდელები ასევე განზრახ პატარაა იმ ჩატბოტებთან შედარებით, რომლებსაც იცავენ. Shieldstral დაახლოებით 3 მილიარდ პარამეტრს შეიცავს — მოკრძალებული რიცხვია ათეულობით მილიარდიანი დიდი ენობრივი მოდელის გვერდით — და მხოლოდ ერთ 16 გბ GPU-ზეც კი მუშაობს. ეს ეფექტურობა მნიშვნელოვანია, რადგან კლასიფიკატორმა უნდა შეამოწმოს ყოველი მოთხოვნა და ყოველი პასუხი, ორივე მიმართულებით, საუბრის შენელების ან პროდუქტის მასშტაბურად გაშვების გაძვირების გარეშე.
არცერთი კლასიფიკატორი არ არის იდეალური. სიმკაცრის ზედმეტად მაღალი დონე უვნებელ შინაარსსაც ბლოკავს (ცრუ-დადებითი შედეგები), ხოლო ზედმეტად დაბალი დონე ნამდვილად საზიანო შინაარსსაც ატარებს. სწორედ ამიტომ, უმეტეს დანერგვაში სიმკაცრის დონის მორგება შესაძლებელია კონკრეტული გამოყენების მიხედვით, ერთხელ და სამუდამოდ დაფიქსირების ნაცვლად.
რატომ არის უსაფრთხოების ფენა ცალკე მოდელი
შინაარსის წესების პირდაპირ მთავარ ჩატბოტის მოდელზე მიმაგრებას ფასი აქვს: ყოველი პოლიტიკის ცვლილება მთელი სისტემის ხელახლა გადამზადებას ან დახვეწას მოითხოვს, და უსაფრთხოების ლოგიკა ერწყმის ყველაფერს, რასაც მოდელი აკეთებს. მისი ცალკე AI უსაფრთხოების მოდელად გამოყოფა ამ ორ ამოცანას აშორებს ერთმანეთს. ძირითადი მოდელის დახვეწა მსჯელობასა თუ წერაში შესაძლებელია იმის შეხების გარეშე, თუ როგორ ფილტრავენ შინაარსს, ხოლო ფილტრის წესების გამკაცრება, შერბილება თუ მომხმარებლის მიხედვით მორგება შესაძლებელია ძირითადი მოდელის საერთოდ გადამზადების გარეშე. სწორედ ამიტომ ქვეყნდება გარდრეილ მოდელები სულ უფრო ხშირად დამოუკიდებელ, ღია წონების ინსტრუმენტებად — როგორც Mistral AI-მ ეს Shieldstral-ის შემთხვევაში გააკეთა — და არა ერთი კომპანიის პროდუქტში ჩაკეტილად: ნებისმიერ გუნდს, რომელიც უკვე მართავს საკუთარ ჩატბოტს, შეუძლია ის დამატებით ფენად ჩართოს.
რატომ აქვს მნიშვნელობა
მანქანური სწავლების კლასიფიკატორებამდე, მასშტაბური კონტენტის მოდერაცია ძირითადად საკვანძო სიტყვების შავ სიებსა და ადამიანური განხილვის რიგებს ნიშნავდა — ხისტი, ნელა განახლებადი და ადვილად გვერდის ავლადი, თუნდაც აკრძალული სიტყვის არასწორად დაწერით. გაწვრთნილი კლასიფიკატორი მნიშვნელობას კითხულობს და არა უბრალოდ სტრიქონებს ადარებს, ამიტომ მას შეუძლია აღმოაჩინოს შენიღბული ან ნაგულისხმევი საზიანო მოთხოვნა, რომელსაც საკვანძო სიტყვის ფილტრი გამოტოვებდა, ხოლო ცალსახად უვნებელ შეტყობინებას სწორად გაატარებს, რასაც საკვანძო სიტყვის ფილტრი შეცდომით დაბლოკავდა — მაგალითად, ექთანი, რომელიც წამლის დოზირებაზე იკითხავს.
სწორედ ამიტომ იქცევა გარდრეილ მოდელები AI სისტემის სტანდარტულ, თითქმის უხილავ ფენად — ისევე, როგორც სპამის ფილტრი ელფოსტის წინ დგას. დღეს მსხვილი AI ლაბორატორიების უმეტესობა გვთავაზობს ან გვირჩევს მსგავს ინსტრუმენტს — OpenAI-ს აქვს საკუთარი Moderation API, Meta-მ გამოუშვა Llama Guard, ხოლო Mistral AI-ს — Shieldstral. რადგან სულ უფრო მეტი პროდუქტი უმატებს ჩატბოტს საიტსა თუ აპლიკაციაში, სპეციალიზებული კლასიფიკატორი დგას მომხმარებლის შეტყობინებასა და სისტემის იმ ნაწილს შორის, რომელიც რეალურად ქმნის პასუხს — მათ შორის იჭერს ჯეილბრეიქის მცდელობებსაც, როცა ვინმე ცდილობს, დაარწმუნოს მოდელი, უგულებელყოს საკუთარი უსაფრთხოების წესები.
სიახლეებში
Mistral AI-მ Shieldstral გამოუშვა ღია წონების მოდელად, Apache 2.0 ლიცენზიით, NVIDIA-სთან და სხვა პარტნიორებთან ერთად, ახლადშექმნილი Open Secure AI Alliance-ის ფარგლებში — რითაც თანამედროვე დონის გარდრეილ მოდელი ხელმისაწვდომი გახდა ნებისმიერი გუნდისთვის და არა მხოლოდ დიდი ლაბორატორიებისთვის, რომლებსაც საკუთარი მსგავსი მოდელის შესაქმნელად საკმარისი რესურსი გააჩნიათ.