
Model o 2,8 bilionach parametrów z oknem kontekstowym na poziomie 1 miliona tokenów został zbudowany w oparciu o architekturę mixture-of-experts: z 896 ekspertów aktywowanych jest tylko 16, co obniża koszt inferencji. Według własnych danych Moonshot, wydajność skalowania wzrosła około 2,5 razy w porównaniu z poprzednią wersją. Na szerszych benchmarkach K3 ustępuje najlepszym konfiguracjom Claude i OpenAI – przewaga ogranicza się do kodowania.
Kontynuuj czytanie tego artykułu w źródle: coindesk.com