ცხრილოვანი მონაცემების საბაზისო მოდელი — ეს არის AI სისტემა, რომელიც სვეტებად და სტრიქონებად დალაგებული მონაცემებიდან — მომხმარებელთა ჩანაწერები, ტრანზაქციების ჟურნალები, საწყობის აღრიცხვა, სადაზღვევო პრეტენზიები — პროგნოზებს პირდაპირ აკეთებს, ყოველი ახალი მონაცემთა ნაკრებისთვის ხელახლა გაწვრთნის გარეშე. თუ დიდი ენობრივი მოდელი, ChatGPT-ის მსგავსი, წინადადებაში მომდევნო სიტყვას წინასწარმეტყველებს, ცხრილოვანი მონაცემების საბაზისო მოდელი წინასწარმეტყველებს ცხრილში მომდევნო მნიშვნელობას: დატოვებს თუ არა კლიენტი კომპანიას, დაგვიანდება თუ არა გადახდა, რამდენი გაიყიდება ამ პროდუქტიდან მომავალ თვეს.
რა არის ეს
ბიზნესის მონაცემების უმეტესი ნაწილი პროზად წაკითხვისთვის არასდროს ყოფილა განკუთვნილი — ის ცხრილების სახით არსებობს: ერთი სვეტი კლიენტის ID-სთვის, მეორე შეკვეთის მოცულობისთვის, მესამე კი იმისთვის, გააუქმა თუ არა ანგარიში მოგვიანებით. ათწლეულზე მეტია, ასეთი მონაცემებიდან პროგნოზირების სტანდარტული მეთოდი იყო გრადიენტული გაძლიერება — მიდგომა, რომელსაც იყენებენ ისეთი ხელსაწყოები, როგორიცაა XGBoost და LightGBM და რომლებიც დღემდე ფართოდაა გავრცელებული მონაცემთა მეცნიერების გუნდებში. ეს მეთოდი კარგად მუშაობს, მაგრამ ყოველი ახალი მონაცემთა ნაკრებისთვის ცალკე მოდელის გაწვრთნას მოითხოვს — საკუთარი მახასიათებლების დამუშავებითა და პარამეტრების მორგებით.
ცხრილოვანი მონაცემების საბაზისო მოდელი (TFM) სხვაგვარად მოქმედებს — მისი იდეა იმ პრინციპიდანაა ნასესხები, რომლის მეშვეობითაც დიდი ენობრივი მოდელები ახერხებენ განზოგადებას ისეთ თემებზეც, რომლებიც მათ პირდაპირ არასდროს ასწავლეს. ერთი ვიწრო ამოცანის სწავლის ნაცვლად, ის ერთხელ, წინასწარ გაიწვრთნება უზარმაზარ, მრავალფეროვან მონაცემებზე და შემდეგ გამოიყენება ახალ, დაუკავშირებელ ცხრილებზეც — ხელახალი წვრთნის გარეშე. ყველაზე ცნობილი მაგალითია TabPFN, რომელიც შექმნა გერმანულმა სტარტაპმა Prior Labs-მა. ეს არის კვლევა, გამოქვეყნებული ჟურნალ Nature-ში, რომელმაც საუკეთესო შედეგები აჩვენა ასობით დამოუკიდებელ აკადემიურ ტესტში. სწორედ ეს კვლევა დაასახელა SAP-მა კომპანიის შესყიდვის მთავარ მიზეზად — გარიგება, რომლის ღირებულებამაც 1 მილიარდ ევროს გადააჭარბა.
როგორ მუშაობს
ჩვეულებრივი მანქანური სწავლების პროცესი ახალ მოდელს კონკრეტულ მონაცემთა ნაკრებზე წვრთნის, რაც ჩვეულებრივ საათობით მახასიათებლების დამუშავებასა და პარამეტრების მორგებას მოითხოვს, სანამ პროგნოზირებას საერთოდ შეძლებს. ცხრილოვანი მონაცემების საბაზისო მოდელი ამ ეტაპს გამოტოვებს. ის წინასწარ, ერთხელ, უკვე გაწვრთნილია მილიონობით სინთეზურ ცხრილზე, რომლებიც უამრავ სტატისტიკურ შაბლონს მოიცავს — ასე რომ, ის უკვე „იცნობს" ცხრილოვანი ამოცანების ზოგად ფორმას, სანამ თქვენს მონაცემებს საერთოდ დაინახავს.
მისი გამოსაყენებლად საკმარისია, თქვენი ნედლი ცხრილი — იმ სტრიქონების ჩათვლით, რომელთა პროგნოზირებაც გსურთ — მოდელს გადასცეთ, ის კი ერთი გავლით, პასუხს დაუყოვნებლივ დააბრუნებს — ცალკე წვრთნის გარეშე, ცარიელი უჯრედებისა და შეუსაბამო მონაცემთა ტიპების ხელით დამუშავების გარეშე. TabPFN-ის უახლესი ვერსია იტევს ცხრილებს 50 000 სტრიქონამდე და 2 000 სვეტამდე, ხოლო TabArena-ს ბენჩმარქზე იმ შედეგებს აღწევს, რომელთა მისაღწევადაც ავტომატიზებულ მანქანური სწავლების პროცესს რამდენიმე საათი დასჭირდებოდა — ანუ სამუშაო, რომელიც ადრე ღამის განმავლობაში სრულდებოდა, ახლა წამებში დასრულებულ მოთხოვნად იქცევა. Prior Labs აქვეყნებს მოდელსა და მის დოკუმენტაციას ყველასთვის, ვისაც საკუთარ მონაცემებზე მისი პირდაპირ გამოცდა სურს.
რატომ არის მნიშვნელოვანი
გენერაციული AI-ს შესახებ სათაურები ძირითადად ტექსტს, სურათებსა და კოდს ეხება, მაგრამ ბიზნესის მონაცემების დიდი ნაწილი, რომელზეც კომპანიები რეალურად დგანან — გადახდების ისტორია, მიწოდების ჯაჭვები, სადაზღვევო პრეტენზიები, სენსორების ჩანაწერები — არა საუბრისთვის, არამედ ცხრილებისთვისაა განკუთვნილი. სწორედ ამაზეა კორპორაციული AI-ს მიმართულებით SAP-ის ფსონი: კომპანიის მთავარი ტექნოლოგიების დირექტორის განცხადებით, სტრუქტურირებული ბიზნესის მონაცემები, და არა ჩატბოტები, არის „კორპორაციულ AI-ში ყველაზე დიდი გამოუყენებელი შესაძლებლობა". კლიენტების დაკარგვის, თაღლითობის, მიწოდების დაგვიანების ან მოთხოვნის უფრო სწრაფი და ზუსტი პროგნოზირება პირდაპირ ერწყმის იმ პროგრამულ უზრუნველყოფას, რომელსაც კომპანიები უკვე იყენებენ ბუღალტერიის, ლოგისტიკისა და კლიენტებთან ურთიერთობის მართვისთვის — და ამისთვის ყოველი ბიზნესისგან საკუთარი მონაცემთა მეცნიერების გუნდის აყვანა აღარ არის საჭირო.
ეს არ ნიშნავს, რომ ცხრილოვანი მონაცემების საბაზისო მოდელები დიდ ენობრივ მოდელებს ცვლიან — ისინი სხვადასხვა ამოცანას წყვეტენ. LLM ენაზე მსჯელობს, ცხრილოვანი მონაცემების საბაზისო მოდელი კი — სტრუქტურირებულ ჩანაწერებზე. სულ უფრო ხშირად ისინი ერთად გამოიყენება: AI აგენტმა შეიძლება LLM-ის დახმარებით გაიგოს მოთხოვნა ჩვეულებრივ ენაზე, შემდეგ კი ცხრილოვან მოდელს მიმართოს, რომ პროგნოზი კომპანიის ბაზაზე რეალურად გაუშვას.
სიახლეებში
SAP-მა Prior Labs-ის შესყიდვა ივლისში დაასრულა და დაპირდა, ოთხი წლის განმავლობაში 1 მილიარდ ევროზე მეტი დააბანდოს მისი გადაქცევისთვის იმად, რასაც კომპანია სტრუქტურირებული მონაცემებისთვის წამყვან, ავანგარდულ AI ლაბორატორიას უწოდებს — იხილეთ ჩვენი გაშუქება გარიგებაზე.
წყაროები: Foundation model — Wikipedia · Gradient boosting — Wikipedia · SAP: SAP to Acquire Prior Labs · Prior Labs დოკუმენტაცია