
Model dengan 2,8 triliun parameter dan jendela konteks sebesar 1 juta token dibangun berdasarkan arsitektur mixture-of-experts: dari 896 ahli, hanya 16 yang diaktifkan, sehingga mengurangi biaya inferensi. Menurut data internal Moonshot, efisiensi skala telah meningkat sekitar 2,5 kali dibandingkan versi sebelumnya. Pada benchmark yang lebih luas, K3 kalah dari konfigurasi terbaik Claude dan OpenAI—keunggulan K3 terbatas pada pemrograman.
Lanjutkan membaca artikel ini di sumber: coindesk.com