
El modelo de 2,8 billones de parámetros con una ventana contextual de 1 millón de tokens está construido sobre la arquitectura mixture-of-experts: de los 896 expertos, solo se activan 16, lo que reduce el costo de la inferencia. Según datos propios de Moonshot, la eficiencia del escalado aumentó aproximadamente 2,5 veces en comparación con la versión anterior. En benchmarks más amplios, K3 cede ante las configuraciones líderes de Claude y OpenAI; su ventaja se limita al codificación.
Continuar leyendo este artículo en la fuente: coindesk.com