Whisper — OpenAI-ის მიერ შექმნილი მოდელია, რომელიც ხმოვან ჩანაწერს უსმენს და მას წერილობით ტექსტად გარდაქმნის — თავადვე ამოიცნობს, რომელ ენაზეა საუბარი, და სურვილის შემთხვევაში ინგლისურად თარგმნის კიდეც. OpenAI-მ ის უფასო, ღია კოდის პროგრამად გამოუშვა 2022 წლის სექტემბერში, ასე რომ ნებისმიერს შეუძლია ჩამოტვირთოს და გაუშვას ფასის გადახდის გარეშე, თუმცა OpenAI ასევე ყიდის მის მართულ (hosted) ვერსიას ფასიანი API-ის საშუალებით, მათთვის, ვისაც პროგრამის დამოუკიდებლად მართვა არ სურს. ის თითქმის 100 ენას მოიცავს, მათ შორის ქართულს, რაც მას იმ იშვიათ ხმის ამოცნობის სისტემებს შორის აქცევს, რომლებიც ინგლისურის, ესპანურის თუ ჩინურის მიღმაც საკმაოდ კარგად მუშაობს. Whisper ხმოვანი AI-ის „მოსმენის“ ნაწილს ფარავს — „საუბრის“ მხარეს კი ისეთი ინსტრუმენტები, როგორიცაა ElevenLabs, ტექსტს ისევ ხმად აქცევენ.
უბრალო ტრანსკრიფციის გარდა, Whisper-ს თარგმნაც შეუძლია: მიაწოდეთ მას ჩანაწერი, ვთქვათ, ფრანგულ ან იაპონურ ენაზე, და ის პირდაპირ ინგლისურ ტექსტს დააბრუნებს, ცალკე თარგმანის ეტაპის გარეშე. თუმცა ჯერჯერობით მას ორ არაინგლისურ ენას შორის პირდაპირი თარგმნა არ შეუძლია — მხოლოდ ინგლისურზე.
რა დაგჭირდებათ
Whisper-ის გამოყენების წესი დამოკიდებულია იმაზე, რამდენად თავად გსურთ ყველაფრის გამართვა:
- კოდირების გარეშე: არაერთი ტრანსკრიფციის, სუბტიტრების ან შენიშვნების აპლიკაცია Whisper-ს ფონურად იყენებს — უბრალოდ ატვირთავთ აუდიოფაილს მათ ინტერფეისში.
- უფასო, ლოკალური და პირადი: Whisper-ის კოდი და მოდელის წონები MIT ლიცენზიით არის გამოშვებული, ასე რომ ნებისმიერს შეუძლია დააყენოს ის და საკუთარ კომპიუტერზე ტრანსკრიფცია გაუკეთოს ხმოვან ფაილებს — არაფერი ტოვებს თქვენს მოწყობილობას. ამ გზას სჭირდება წინასწარ დაინსტალირებული Python და აუდიო-ინსტრუმენტი FFmpeg.
- ფასიანი, მართული და მარტივად ინტეგრირებადი: დეველოპერებს, რომლებსაც სურთ ტრანსკრიფციის დამატება საკუთარ აპლიკაციაში, შეუძლიათ პირდაპირ OpenAI-ის API-ს მიმართონ, რაც არც პროგრამის თავად გაშვებას საჭიროებს და არც აპარატურის მართვას — მაგრამ ამ შემთხვევაში აუდიო თქვენს მოწყობილობას ტოვებს და OpenAI-ის სერვერებზე იგზავნება.
ნაბიჯ-ნაბიჯ
Whisper-ის თავად გასაშვებად, პირველ რიგში დააინსტალირეთ FFmpeg თქვენი ოპერაციული სისტემისთვის, შემდეგ კი დააყენეთ თავად მოდელი ბრძანებით:
pip install -U openai-whisper
აქედან, ერთი ბრძანება საკმარისია ფაილის ტრანსკრიფციისთვის: whisper audio.mp3 --model turbo. Whisper ექვსი ზომით მოდის — tiny-დან (სწრაფი, ნაკლებად ზუსტი, თითქმის ნებისმიერ ლეპტოპზე მუშაობს) large-მდე (უფრო ნელი, ყველაზე ზუსტი, კარგ გრაფიკულ ბარათს საჭიროებს); turbo მოდელი გონივრული არჩევანია, რადგან თითქმის ისეთივე ზუსტია, როგორც large, მაგრამ შესამჩნევად უფრო სწრაფი.
OpenAI-ის მართული ვერსიის გამოსაყენებლად კი გაიარეთ რეგისტრაცია OpenAI API-ზე და მიჰყევით ოფიციალურ სახელმძღვანელოს, რომელიც გიჩვენებთ, როგორ გაუგზავნოთ აუდიოფაილი API-ის ბოლოწერტილს (endpoint) და დაიბრუნოთ ტექსტური ტრანსკრიფცია. ეს ფასიანია: 2026 წლის სექტემბრის მდგომარეობით, OpenAI-ის თავდაპირველი whisper-1 მოდელი ღირს $0.006 აუდიოს ერთ წუთზე (დაახლოებით $0.36 საათზე), ხოლო ახალი ტრანსკრიფციის მოდელები ოდნავ განსხვავებულად ფასდება — რაიმეს აშენებამდე ღირს OpenAI-ის ფასების გვერდის გადამოწმება, რადგან ტარიფები იცვლება.
რჩევები და ხაფანგები
Whisper საერთო ჯამში ზუსტია, მაგრამ მას ცნობილი თავისებურებებიც აქვს. მას შეუძლია „ჰალუცინაცია“ — ისეთი წინადადებების გამოგონება, რომლებიც საერთოდ არ ითქმევა — ხანგრძლივი სიჩუმის ან ფონური ხმაურის დროს, ამიტომ მისი შედეგი მნიშვნელოვან საკითხებში ადამიანური გადამოწმების გარეშე არ უნდა ჩაითვალოს საბოლოო ჭეშმარიტებად. 25 მბ-ზე დიდი აუდიოფაილები API-ში ატვირთვამდე უნდა დაიყოს ნაწილებად. და მიუხედავად იმისა, რომ Whisper-ის ტრანსფორმერზე დაფუძნებული არქიტექტურა ინტერნეტიდან მოძიებული 680,000 საათის აუდიოთი გაწვრთნილა, ნაკლებად წარმოდგენილმა ენებმა ინგლისურთან შედარებით გაცილებით ნაკლები სავარჯიშო მონაცემები მიიღეს — ამიტომ ისეთ ენებზე, როგორიცაა ქართული, სიზუსტე, თუმცა გამოსადეგია, ინგლისურს ან ესპანურს ვერ გაუტოლდება. ლოკალურ და მართულ ვერსიებს შორის არჩევანი ძირითადად კონფიდენციალურობასა და მოხერხებულობას შორის კომპრომისია: ლოკალური Whisper მგრძნობიარე ჩანაწერებს — სამედიცინო ჩანიშვნებს, იურიდიულ საუბრებს, შიდა შეხვედრებს — მესამე მხარის სერვერებისგან იცავს, API კი ამას მარტივი გამოყენების სანაცვლოდ სწირავს.
რას მოუტანს საქართველოს
ქართული Whisper-ის მხარდაჭერილ ენებს შორისაა, კოდით „ka“ — იშვიათი შემთხვევაა, როცა AI-ის დიდი ხმოვანი მოდელი ენას პირდაპირ იყენებს, ინგლისურზე გავლის გარეშე. ეს მას ნამდვილად გამოსადეგს ხდის ქართული შეხვედრების ოქმების, სუბტიტრების ან კარნახისთვის, და კარგად ეხამება მზარდ AI თარგმანის ინსტრუმენტებს, რომლებსაც შეუძლიათ საქმეში ჩაერთონ მას შემდეგ, რაც Whisper ქართულ ხმას ქართულ ტექსტად აქცევს.