
En termes de performance, elle n'est pas inférieure à Claude Fable 5.1 pour la plupart des tâches et coûte 40 % moins cher à exploiter que Opus 5.
D'après les benchmarks publiés, cette modèle devance GPT-5.6 Sol dans 6 tests sur 6, et GPT-6 Astra dans 4 tests sur 6 (des tests indépendants confirment au minimum un résultat de Terminal-Bench 4.0 : 66,4 % contre 57,9 % pour Astra)
Les utilisateurs signalent une nette augmentation de la vitesse lors d'applications réelles — par exemple, l'audit d'une base de code de 200 000 lignes a pris moins de 3 heures, contre plus de 20 heures avec la version précédente.