
प्रदर्शन के मामले में यह ज्यादातर कार्यों में Claude Fable 5.1 से कम नहीं है और Opus 5 की तुलना में इसका परिचालन 40% सस्ता पड़ता है।
रिलीज़ में बेंचमार्क्स के मुताबिक, यह मॉडल 6 में से 6 सामान्य परीक्षणों में GPT-5.6 Sol को पीछे छोड़ देता है, और GPT-6 Astra को 6 में से 4 में पीछे छोड़ देता है (स्वतंत्र परीक्षणों से Terminal-Bench 4.0 के कम से कम 66.4% की पुष्टि होती है: Astra के 57.9% के खिलाफ)
उपयोगकर्ता वास्तविक कार्यों पर गति में उल्लेखनीय वृद्धि का उल्लेख करते हैं—उदाहरण के लिए, 200,000 स्ट्रिंग्स की कोड बेस का ऑडिट पिछले संस्करण की तुलना में 3 घंटे से भी कम समय में पूरा हो गया, जबकि पिछले संस्करण में यह 20+ घंटे लगते थे।