
A modelo de 2,8 trilhões de parâmetros com um contexto de 1 milhão de tokens foi construída com a arquitetura mixture-of-experts: dos 896 experts, apenas 16 são ativados, o que reduz o custo da inferência. Segundo dados próprios da Moonshot, a eficiência do escalonamento aumentou aproximadamente 2,5 vezes em relação à versão anterior. Em benchmarks mais amplos, a K3 fica atrás das configurações líderes da Claude e da OpenAI – seu desempenho superior se limita ao codificação.
Continue lendo este artigo na fonte: coindesk.com