
Về hiệu suất, nó không thua Claude Fable 5.1 trong hầu hết các nhiệm vụ và chi phí vận hành thấp hơn 40% so với Opus 5.
Theo các bài kiểm tra chuẩn, trong phiên bản phát hành, mô hình này vượt qua GPT-5.6 Sol trong 6/6 bài kiểm tra chung, và vượt qua GPT-6 Astra trong 4/6 bài kiểm tra (các bài kiểm tra độc lập xác nhận ít nhất Terminal-Bench 4.0: 66,4% so với 57,9% của Astra)
Người dùng ghi nhận tốc độ tăng đáng kể khi thực hiện các nhiệm vụ thực tế—ví dụ, việc kiểm tra cơ sở mã gồm 200 nghìn dòng chỉ mất chưa đến 3 giờ, so với hơn 20 giờ của phiên bản trước.
Tiếp tục đọc bài viết này tại nguồn: anthropic.com