
2.8 ट्रिलियन पैरामीटर वाला मॉडल, जिसकी कंटेक्स्टुअल विंडो 1 मिलियन टोकन है, मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर पर बनाया गया है: 896 एक्सपर्ट्स में से केवल 16 को सक्रिय किया जाता है, जिससे इंफ़रेंस की लागत कम हो जाती है। Moonshot के अपने डेटा के अनुसार, स्केलिंग की दक्षता पिछले संस्करण की तुलना में लगभग 2.5 गुना बढ़ गई है। व्यापक बेंचमार्क K3 पर, यह Claude और OpenAI के शीर्ष कॉन्फ़िगरेशन को पीछे छोड़ देता है—इसकी बढ़त केवल कोडिंग में सीमित है।
स्रोत पर इस लेख को पढ़ना जारी रखें: coindesk.com