Google DeepMind-მა 30 ივლისს წარადგინა Gemini Robotics 2 — სამი AI მოდელისგან შემდგარი ნაკრები, რომელიც ჰუმანოიდურ რობოტებს პირველად აძლევს საშუალებას, მთელი სხეულით დაგეგმონ და შეასრულონ მოძრაობა, მხოლოდ მკლავებისა და ხელების ნაცვლად — ამის შესახებ კომპანიამ საკუთარ ბლოგში განაცხადა. სისტემა Apptronik-ის ჰუმანოიდზე, Apollo 2-ზე გამოსცადეს, რომელსაც ახლა შეუძლია სიარული, მუხლის მოხრა, დახრა და საგნებთან მანიპულირება, სანამ რეალურ დროში მრავალსაფეხურიან ამოცანებზე მსჯელობს, DeepMind-ის განცხადებით.

სამი მოდელი, ერთი რობოტი

ნაკრები დატვირთვას სამ კომპონენტს შორის ანაწილებს. თავად Gemini Robotics 2 არის ხედვა-ენა-მოქმედების (VLA) მოდელი, რომელიც იმას, რასაც რობოტი ხედავს და ესმის, მთელი სხეულის მამოძრავებელ ბრძანებებად გარდაქმნის — DeepMind-ის სიტყვებით, „ტერფებიდან თითებამდე“. Gemini Robotics ER 2 კი უფრო მაღალი დონის დამგეგმავია: რთულ ინსტრუქციებს ეტაპებად ყოფს, ადამიანებთან საუბრობს და, ამ ვერსიის სიახლედ, ერთსა და იმავე ამოცანაზე მომუშავე რამდენიმე რობოტს კოორდინაციას უწევს. Gemini Robotics On-Device 2 კი ლოკალურად, თავად რობოტის აპარატურაზე მუშაობს და ახალ რობოტულ სხეულს რამდენიმე საათში ეგუება — წინა ვერსიებისთვის საჭირო ხანგრძლივი ხელახალი წვრთნის ნაცვლად.

DeepMind-ის საკუთარმა ტესტებმა, რომლებიც გამოშვებასთან ერთად გამოქვეყნდა, ამოცანების მიხედვით დიდი სხვაობა აჩვენა: მთელი სხეულის მანიპულაციაში წარმატების მაჩვენებელი დაახლოებით 46%-დან 76%-მდე მერყეობდა, დამჭერზე დამყარებულ სიმარჯვის ამოცანებში — 74%-დან 90%-მდე, ხოლო თითების სიმარჯვის დახვეწილ ამოცანებში — 32%-დან 92%-მდე. კომპანიის თქმით, ეს სხვაობა აჩვენებს, რამდენად განსხვავებულია ფიზიკური ამოცანების სირთულე რობოტებისთვის.

პროგრამულზე ფსონი, არა აპარატურაზე

ეს გამოშვება აგრძელებს Google-ის სტრატეგიას — რობოტებისთვის „ინტელექტის ფენის“ მიწოდებას, რომელთა აპარატურასაც სხვა კომპანიები აწარმოებენ, საკუთარი რობოტის შექმნის ნაცვლად. იგივე მიდგომა გამოიყენა კომპანიამ ადრეული Gemini Robotics ER 2-ის დროსაც. Apptronik-ის გარდა, DeepMind-ის თქმით, ახალი მოდელები ასევე გამოსცადეს Boston Dynamics-ის, Franka-სა და Agile Robots-ის აპარატურაზე. Gemini Robotics ER 2 ახლა ხელმისაწვდომია Google AI Studio-ში და კერძო წინასწარ ჩვენებაშია Gemini Enterprise Agent პლატფორმაზე, ხოლო სრული VLA და ლოკალური მოდელები ჯერჯერობით მხოლოდ შერჩეულ ადრეულ პარტნიორებს მიუწვდებათ.

გამოშვება ხდება მაშინ, როცა ჰუმანოიდური რობოტები კვლევითი დემონსტრაციებიდან რეალურ დანერგვას უახლოვდება, მარეგულირებლები კი ამ პროცესის აპარატურულ მხარესაც სულ უფრო ყურადღებით აკვირდებიან — წელს FCC-მ ახალი ჩინური წარმოების ჰუმანოიდური რობოტების აშშ-ში ავტორიზაცია აკრძალა უსაფრთხოების მოსაზრებებით. ჯერჯერობით, DeepMind-ის ეს ნაბიჯი გვაფიქრებინებს, რომ რობოტიკაში ყველაზე რთულად ამოსახსნელი ამოცანა შეიძლება იყოს არა იმდენად საუბრის სწავლება, რამდენადაც მოძრაობის სწავლება.

ასევე წაიკითხეთ