Cerebras Systems-მა 18 აგვისტოს, Supernova 2026 ღონისძიებაზე, ახალი rack-scale AI სისტემა CS-4 წარადგინა. კომპანიის ოფიციალური განცხადებით, ახალი სისტემა დასკვნის (inference) სისწრაფეში GPU-ზე დაფუძნებულ სერვერებს 30-ჯერ აღემატება.
სისტემაში სამი ახალი Wafer Scale Engine 3 Turbo (WSE-3T) პროცესორია გაერთიანებული — თითოეული აგებულია იმავე 5-ნანომეტრიან ფირფიტაზე, რომელსაც 4 ტრილიონი ტრანზისტორი აქვს და რომელზეც CS-3-იც იყო აგებული, თუმცა ახალი ჩიპი დაახლოებით ორჯერ მაღალი სიხშირით მუშაობს. ეს ყველაფერი მოთავსებულია განახლებულ კარკასში, რომელსაც კომპანია Nexus პლატფორმას უწოდებს. Cerebras-ის თქმით, ახალმა დიზაინმა კარკასის კომპონენტების რაოდენობა განახევრა და თითოეული ჩიპისთვის მიწოდებული სიმძლავრე გააორმაგა. ათ ტრილიონზე მეტი პარამეტრის მქონე მოდელებისთვის კომპანია აცხადებს, რომ CS-4 წამში 1000-ზე მეტ ტოკენს გენერირებს თითო მომხმარებელზე, ფირფიტებს შორის დაყოვნება მხოლოდ ორ მიკროწამამდე დადის, ხოლო ვატზე გამომუშავებული ტოკენების რაოდენობა CS-3-თან შედარებით 10-ჯერამდე იზრდება.
„გაყოფილი“ დასკვნისთვის აგებული
დღეს ბევრი AI სისტემა დასკვნის პროცესს ორ ეტაპად ყოფს: „prefill“, როცა მოდელი შემოსულ მოთხოვნას ამუშავებს, და „decode“, როცა პასუხს ტოკენ-ტოკენ აგენერირებს. Cerebras-ის განცხადებით, CS-4 სწორედ ამ გაყოფილი მიდგომისთვისაა აგებული — prefill ეტაპს AMD-ის Helios სისტემები და AWS-ის Trainium ჩიპები ასრულებენ, ხოლო decode ეტაპზე, სადაც კომპანიის თქმით ყველაზე სწრაფია, პასუხს თავად wafer-scale აპარატურა გენერირებს.
ეს გამოშვება აგრძელებს Cerebras-ის სტრატეგიას, რომლის ფარგლებშიც კომპანია დასკვნის სისწრაფეს, ვარჯიშის სიმძლავრისგან განსხვავებით, გაყიდვების მთავარ არგუმენტად აქცევს. კომპანიამ ამ თვის დასაწყისში OpenAI-სთან პარტნიორობა გამოაცხადა — იგივე wafer-scale ტექნოლოგიაზე აგებული „Ultrafast“ რეჟიმისთვის GPT-5.6 Sol-ში.
ხელმისაწვდომობა
Cerebras-ის თქმით, CS-4-ის პირველი პარტიების გაგზავნა 2026 წლის მესამე კვარტალშია დაგეგმილი, ხოლო ფართო ხელმისაწვდომობა წლის ბოლოსკენ მოჰყვება. ფასი კომპანიას ჯერჯერობით არ გაუმჟღავნებია.
გამოშვება ემატება ზაფხულის განმავლობაში გამოცხადებულ AI აპარატურის სიახლეების სერიას, რომლებიც ყველა ერთი მიზნისკენაა მიმართული — მზარდი მოდელების გაშვების ღირებულების შემცირებისკენ, რადგან დასკვნის გამოთვლითი სიმძლავრე კვლავ AI ლაბორატორიებისა და ღრუბლოვანი პროვაიდერების ერთ-ერთ უმსხვილეს ხარჯად რჩება.