Google DeepMind-მა წარადგინა SL2T — ჟესტური ენის ტექსტად გადამყვანი AI მოდელი, რომელიც მომხმარებელს საშუალებას აძლევს ტელეფონს პირდაპირ ჟესტებით მიმართოს, კლავიატურაზე აკრეფის ნაცვლად. კომპანიის განცხადებით, ეს არის ჟესტური ენის AI-ის პირველი დანერგვა ფართო მომხმარებლისთვის განკუთვნილ პროგრამულ პროდუქტში.
სად გამოჩნდება
მოდელი ორ არსებულ Google-ის აპლიკაციაში ინტეგრირდება: Gboard-ში, სადაც მომხმარებელს შეუძლია ჟესტებით მოძებნოს ინფორმაცია ინტერნეტში, დაწეროს შეტყობინება ან Gemini-ს კითხვა დაუსვას, და Live Transcribe-ში, სადაც ყრუ და სმენადაქვეითებულ მომხმარებლებს შეუძლიათ საუბრის დროს პასუხი აკრეფის ნაცვლად ჟესტებით გადმოსცენ. ორივე ფუნქცია უფასოა და თავდაპირველად Pixel 11-ზე გამოჩნდება, რომელიც 20 აგვისტოს გამოვა; DeepMind-ის თქმით, სხვა მოწყობილობებიც დაემატება.
გაშვებისას SL2T ამერიკულ ჟესტურ ენას (ASL) ინგლისურად თარგმნის. DeepMind-ის განცხადებით, დამატებითი ჟესტური ენების მხარდაჭერაც იგეგმება, თუმცა ვადები ჯერ არ არის ცნობილი.
როგორ შეიქმნა
DeepMind-ის ინფორმაციით, SL2T გაწვრთნილია 100,000-ზე მეტ საათზე, რაც 50-ზე მეტ ჟესტურ ენას მოიცავს — მათგან დაახლოებით მეოთხედი ASL-ზე მოდის — მრავალფეროვან ჟესტური ენის მოსაუბრეების, დიალექტებისა და დონეების გათვალისწინებით. FLEURS-ASL ბენჩმარკზე მოდელმა ნულოვანი გამოცდილების (zero-shot) რეჟიმში 70 ქულა BLEURT-ში დააგროვა, რაც, კომპანიის თქმით, მნიშვნელოვნად აღემატება ამ ამოცანაზე აქამდე ცნობილ საუკეთესო შედეგებს.
პროექტი დაიწყო სემ სეპასგან — ყრუ Google-ელი თანამშრომლისგან — და მთელი პროცესის განმავლობაში მას AI ჟესტური ენის საკონსულტაციო კომიტეტი (AISLAC) წარმართავდა, რომელშიც ყრუთა ორგანიზაციები და ლინგვისტები შედიან. DeepMind ღიად აღნიშნავს დარჩენილ ხარვეზებსაც: მოდელს ზოგჯერ ჯერ კიდევ უჭირს იშვიათი ჟესტების, სწრაფი დაქტილოლოგიის (fingerspelling), პასიური კონსტრუქციებისა და დროის ფორმების ამოცნობა, ხოლო მარცხენა ხელით ან ტელეფონის დაჭერისას ერთი ხელით ჟესტების გაკეთებაზე ჯერ ბოლომდე ოპტიმიზირებული არ არის.
რატომ აქვს მნიშვნელობა
ჟესტური ენის ამოცნობა დიდი ხანია ჩამორჩება ხმისა და ტექსტის AI-ს, რადგან გამოსადეგი სასწავლო მონაცემები მწირია, ხოლო ჟესტური ენები რეგიონების მიხედვით მკვეთრად განსხვავდება. მოდელის პირდაპირ კლავიატურასა და ტრანსკრიფციის აპში ჩადგმა — ლაბორატორიული დემოს ნაცვლად — DeepMind-ს რეალურ პირობებში საშუალებას აძლევს გამოცადოს, გაუძლებს თუ არა ეს ხელმისაწვდომობის ტექნოლოგია რეალურ ცხოვრებას, და შესაძლოა კონკურენტი მწარმოებლებიც მსგავსი ფუნქციების დამატებისკენ უბიძგოს.
გამოშვება მოსდევს წლების განმავლობაში შექმნილ, უფრო მცირე მასშტაბის ჟესტური ენის AI პროტოტიპებს; DeepMind-ის საკუთარმა კვლევამ გლოსების გარეშე თარგმანის (gloss-free) მიმართულებით — ცალკეული ჟესტების მარკირების შუალედური ეტაპის გამოტოვებით — განაპირობა ეს ნახტომი ბენჩმარკის სიზუსტეში.