
La modèle de 2,8 billions de paramètres avec une fenêtre contextuelle de 1 million de tokens est construit sur l'architecture « mixture-of-experts » : parmi 896 experts, seuls 16 sont activés, ce qui réduit le coût de l'inférence. Selon ses propres données, Moonshot a vu son efficacité de mise à l'échelle augmenter d'environ 2,5 fois par rapport à la version précédente. Sur des benchmarks plus larges, K3 reste derrière les configurations de pointe de Claude et OpenAI – son avantage se limite au codage.
Continuer la lecture de cet article sur la source: coindesk.com