
AutomationBench Sol পরীক্ষায় Claude Opus 5 (৩৩.২% বনাম ২৬.৯%) এবং Fable 5.1 (৩১.৪%) কে ছাড়িয়ে যায়—এই পরীক্ষায় কাজ সম্পাদন করতে Opus 5 এর তুলনায় প্রায় ১১ গুণ কম খরচ হয়।
আসল ত্রুটির অভ্যন্তরীণ পরীক্ষায় Sol এর ত্রুটি GPT-5.6 Sol এর তুলনায় অর্ধেক হয়ে যায়। মডেলটি Astra-র নির্ভরযোগ্যতার কাছাকাছি চলে এসেছে কম দামে। Sol-এর বেসিক API ট্যারিফ ৫০% কমানো হয়েছে ($2/$10 মিলিয়ন টোকেনের জন্য), Luna-র জন্য ৫০-৫৮% কমানো হয়েছে।
Sol - জটিল কোডিং এবং এজেন্ট কাজের জন্য (ফিচার ডেভেলপমেন্ট, কোড রিভিউ, ডিবাগ, ডেটা অ্যানালাইসিস), Luna - সামারাইজেশন এবং ডেটা এক্সট্রাকশনের মতো আরও সহজ এবং ব্যাপক কাজের জন্য।
উৎসে এই নিবন্ধটি পড়া চালিয়ে যান: openai.com