Alibaba-ს Qwen გუნდმა გამოაქვეყნა Qwen3.8-Flash-Next — ღია წონების მოდელი, რომელიც აგებულია ახალ არქიტექტურაზე, რომელსაც კომპანია მომავალი Qwen4 ოჯახის საფუძვლად მოიაზრებს. ეს ექსპერტთა ნაზავის (mixture-of-experts) ტიპის მოდელი 125 მილიარდი პარამეტრიდან თითო ტოკენზე მხოლოდ 6 მილიარდს ააქტიურებს, ამასთანავე ცალკე იყენებს 51-მილიარდპარამეტრიან საძიებო ცხრილს, რომელსაც კომპანია N-gram Embedding-ს უწოდებს.

უფრო იაფი გზა უფრო დიდი მოდელებისკენ

Alibaba-ს განცხადებით, Qwen3.8-Flash-Next-ის წვრთნას წინამორბედთან, Qwen3.7-Plus-თან შედარებით, დაახლოებით 9-ჯერ ნაკლები გამოთვლითი რესურსი დასჭირდა, თუმცა კოდირებისა და აგენტური ამოცანების შესრულებაში მას სჯობნის კიდეც. ეს ეფექტურობა ოთხი არქიტექტურული სიახლიდან მომდინარეობს: ჰიბრიდული ყურადღების მექანიზმი, რომელიც აერთიანებს Gated DeltaNet-სა და Qwen Sparse Attention-ს გრძელი კონტექსტის იაფად შესაკუმშად; „Gated Residual" დიზაინი, რომელიც აფართოებს მოდელის შიდა საინფორმაციო არხებს; N-gram Embedding-ის ცხრილი, რომელიც მოცულობას მატებს გამოთვლით თითქმის არავითარი დამატებითი დანახარჯის გარეშე; და Muon ოპტიმიზატორის დახვეწილი ვერსია.

Alibaba-ს საკუთარი ტესტების მიხედვით, მოდელი კოდირებისა და აგენტური ამოცანების არაერთ ტესტში სჯობნის საკუთარ Qwen3.8-27B-ს და DeepSeek-ის V4-Flash-ს, ზოგიერთ მაჩვენებელში კი კონკურენციას უწევს Anthropic-ის Claude Opus 4.6-საც — თუმცა, როგორც მწარმოებლების მიერ თვითონ გამოქვეყნებული ბენჩმარკების უმეტესობის შემთხვევაში, ეს მონაცემები დამოუკიდებლად არ დამოწმებულა.

ნაცნობი სცენარით

გამოშვება იმეორებს იმ სქემას, რომლითაც Alibaba-მ Qwen3-Next წარადგინა Qwen3.5 ოჯახის წინ: ჯერ ახალი არქიტექტურა უფრო მცირე, ღია წონების მოდელის სახით გამოდის, დეველოპერები მას სცდიან, შემდეგ კი დასკვნები ფლაგმანურ გამოშვებაში აისახება. სრული წონები და FP8 ვერსია უკვე ხელმისაწვდომია Hugging Face-სა და ModelScope-ზე; Alibaba-ს განცხადებით, უახლოეს მომავალში მისი „Qwen3.8-Flash" ვერსია QwenCloud API-ის საშუალებითაც გახდება ხელმისაწვდომი, დაახლოებით $0.16-ად მილიონ შემავალ ტოკენზე.

გამოშვება ემატება ჩინური ღია წონების მოდელების დატვირთულ თვეს — მასთან ერთდროულადაც კი გამოვიდა Qwen3.8-27B და 2.4-ტრილიონპარამეტრიანი Qwen3.8-Max. ტემპი აჩვენებს, რამდენად სწრაფად ვითარდებიან ჩინეთის AI ლაბორატორიები ღია წონების მოდელების სფეროში, მიუხედავად იმისა, რომ თავად Qwen4 ჯერ არც კი გამოცხადებულა.