Thinking Machines-მა Inkling-Small გამოუშვა — დიდ მოდელსაც სჯობნის
Thinking Machines Lab-ის მეორე ღია წონების მოდელი წინამორბედის აქტიური პარამეტრების მხოლოდ მეოთხედს იყენებს, თუმცა მსჯელობისა და კოდირების ტესტებში სჯობნის მას.
ვრცლად →პროექტი შეჩერებულია: ახალი სტატიები და გამოშვებები აღარ გამოქვეყნდება. არქივი ხელმისაწვდომი რჩება.
ექსპერტთა ნარევი (Mixture of Experts, ანუ MoE) არის AI მოდელის არქიტექტურა, რომელიც ასობით მილიარდ პარამეტრს იტევს, მაგრამ თითოეული მოთხოვნისთვის მათ მხოლოდ მცირე ნაწილს ააქტიურებს. ეს ძალიან დიდ მოდელებს სწრაფად და იაფად მუშაობის საშუალებას აძლევს და დღევანდელი მრავალი წამყვანი სისტემის საფუძველია. ეს გვერდი განმარტავს, როგორ მუშაობს MoE და რატომ არის ის მნიშვნელოვანი.
Thinking Machines Lab-ის მეორე ღია წონების მოდელი წინამორბედის აქტიური პარამეტრების მხოლოდ მეოთხედს იყენებს, თუმცა მსჯელობისა და კოდირების ტესტებში სჯობნის მას.
ვრცლად →DeepSeek-ის ოფიციალურმა V4-Flash-0731-მა კოდირებისა და აგენტულ ბენჩმარკებზე გადააჭარბა საკუთარ უფრო დიდ V4-Pro მოდელს, მიუხედავად იმისა, რომ თითოეულ ტოკენზე გაცილებით ნაკლები პარამეტრი აქვს აქტიური.
ვრცლად →Ant Group-ის Ling-3.0-Flash მხოლოდ 5.1 მილიარდი აქტიური პარამეტრით მსჯელობისა და კოდირების ბენჩმარქებზე რამდენჯერმე დიდ მოდელებს შეედრება, კომპანიის თქმით.
ვრცლად →პეკინში დაფუძნებულმა Moonshot AI-მ Kimi K3-ის სრული ღია წონები გამოაქვეყნა — 2.8-ტრილიონპარამეტრიანი მოდელი, რომელსაც კომპანია დღემდე გამოქვეყნებულ ყველაზე დიდ ღია მოდელად მოიხსენიებს.
ვრცლად →Poolside-ის ახალი 118-მილიარდპარამეტრიანი Laguna S 2.1 აგენტური კოდირების ბენჩმარქებში გაცილებით დიდ მოდელებს ეჯიბრება და ღია ლიცენზიით ვრცელდება.
ვრცლად →ჩინურმა Moonshot AI-მ გამოუშვა Kimi K3 — 2.8-ტრილიონპარამეტრიანი ღია მოდელი 1 მილიონ ტოკენამდე საკონტექსტო ფანჯრით, რომელსაც კომპანია მსოფლიოში პირველ ღია 3-ტრილიონიან-კლასის AI მოდელად მოიხსენიებს.
ვრცლად →Mixture of Experts (MoE) საშუალებას აძლევს AI მოდელს, შეინახოს ასობით მილიარდი პარამეტრი, თუმცა თითო მოთხოვნაზე მხოლოდ მისი ნაწილი აქტიურდება — ამიტომ ზოგი უზარმაზარი მოდელი გაშვებაში იაფია.
ვრცლად →