۳۱ شهریور ۲۵۸۵ · 9 دقیقه مطالعه
Opus 5.5 با ۴۰٪ قیمت Fable 5.1 ازش جلو میزنه. جدول benchmark رو دوبار بخون.
Anthropic امروز، بیستودوم سپتامبر ۲۰۲۶، Opus 5.5 رو منتشر کرد. دو ماه پیش نوشتم که داستان اصلی Opus 5 تغییرات API بود، نه benchmarkها. این بار benchmarkها ارزش یه نگاه دقیقتر رو دارن، تا حدی چون بزرگن و تا حدی چون اولین اجرای مستقل همین الان با یکیشون مخالفه.
اول یه چیز، چون دنبالش گشتم: هنوز Sonnet 5.5 نداریم. اعلامیه میگه Sonnet 5.5 و Haiku 5.5 «تو هفتههای بعد» با بهبودهای مشابه میان. پس این پست فقط درباره Opus 5.5 هست، و Sonnet 5 هنوز Sonnet فعلیه.
انتخاب سریع
| اگه تو… | انتخاب | چرا |
|---|---|---|
| sessionهای طولانی agentic coding اجرا میکنی | Opus 5.5 | تو همه جدولها، از جمله جدول مستقل، تو Terminal-Bench 4.0 و FrontierCode اوله |
| برای کار coding قیمت Fable 5.1 رو میدی | Opus 5.5 | امتیاز بالاتر با $4/$20 در مقابل $10/$50 مال Fable |
| کار agentic علمی یا اتوماسیون workflowهای SaaS میکنی | GPT-6 Astra رو هم تست کن | Astra تو Terminal-Bench-Science و AutomationBench اوله |
به thinking: disabled یا forced tool use تکیه داری | تا migrate نکردی رو Opus 5 بمون | هر دو حالا 400 برمیگردونن |
| منتظر یه ارتقای ارزونتر تو رده میانی هستی | فعلاً Sonnet 5 | Sonnet 5.5 اعلام شده، منتشر نشده |
جدول Anthropic
این مقایسه کامل از صفحه معرفی هست:
| Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1 (Main) | 54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | n/a | 41.7% |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 | 1588 |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Humanity’s Last Exam (tools) | 67.7% | 65.6% | 63.6% | 57.2% | n/a |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| OSWorld 2.0 (partial) | 81.8% | 80.7% | 74.0% | n/a | n/a |
| Chartography (tools) | 89.0% | 88.4% | 83.4% | n/a | n/a |
تیتر اصلی ردیف اوله. Terminal-Bench یه agent رو اندازه میگیره که تو یه shell واقعی روی taskهای چندمرحلهای کار میکنه، که نزدیکترین benchmark عمومی به کاریه که من واقعاً کل روز با این مدلها میکنم. یه جهش از ۵۲٫۳٪ به ۶۶٫۴٪ تو دو ماه، و ۱۰ امتیاز جلوتر از Fable 5.1، بزرگترین پیشرفت یه release تنها روی این benchmark میشه که تا حالا دیدم.
GDPval-AA اون یکی عدد بزرگه. خروجیهای حرفهای (گزارش، spreadsheet، تحلیل) رو رودررو امتیاز میده و یه رتبه Elo گزارش میکنه. فاصله ۳۰۰ امتیازی با GPT-6 Astra یعنی Opus 5.5 بیشتر مقایسههای مستقیم رو میبره، نه فقط چندتاشون رو.
دو تا ردیف برعکسه، و Anthropic با این حال چاپشون کرد، که ازش خوشم میاد. Astra تو AutomationBench (workflowهای business روی ابزارهای SaaS) با ۱٫۴ امتیاز جلوئه، فاصلهای کوچیکتر از اونکه مهم باشه. تو Terminal-Bench-Science حدود ۶ امتیاز جلوئه، که اگه agentهات کار scientific computing میکنن، واقعاً مهمه.
اجرای مستقل کوچیکتره
Artificial Analysis همون روز ارزیابیهای خودش رو اجرا کرد. خلاصهشون: Opus 5.5 با max effort تو Intelligence Index اونا ۵۸ میگیره، بالاترین عددی که تا حالا اندازه گرفتن «با چند امتیاز فاصله»، و تو شش تا از ده ارزیابی جزئیشون اوله.
ولی امتیاز Terminal-Bench 4.0 اونا ۵۹٫۶٪ هست، نه ۶۶٫۴٪. این هنوز ۱۱ امتیاز بالاتر از Opus 5 هست، و با GPT-6 Astra با effort xhigh مساویه. چیزی که نشون نمیده یه فاصله ۱۰ امتیازیه. عدد Humanity’s Last Exam اونا ۶۱٫۴٪ هست در مقابل ۶۷٫۷٪ مال Anthropic، هرچند این فاصله دستکم تا حدی بهخاطر اینه که دو تا اجرا setup متفاوتی برای toolها دارن.
این عادیه. vendorها harness، سطح effort و budget مربوط به timeout رو tune میکنن، و ارزیابهای مستقل برای همه مدلها از یه harness استاندارد استفاده میکنن. هیچکدوم از این دو عدد غلط نیست. دارن چیزهای متفاوتی رو اندازه میگیرن: عدد Anthropic نشون میده مدل تو یه setup که براش ساخته شده چی کار میتونه بکنه، و Artificial Analysis نشون میده تو شرایط یکسان با بقیه چطور مقایسه میشه. اگه برای terminal agentها داری بین Opus 5.5 و Astra انتخاب میکنی، خلاصه صادقانه اینه: «مساوی، با قیمت کمتر». این هنوزم نتیجه خوبیه.
کد کمتر، نه همیشه کد بهتر
Sonar ارزیابی کیفیت کد خودش رو روی ۴٬۴۴۴ تا task جاوا از HumanEval، MBPP و ComplexCodeEval اجرا کرد و Opus 5.5 رو با Opus 5 مقایسه کرد. این جالبترین داده روز انتشاره، چون اندازه میگیره کد چه شکلیه، نه فقط اینکه pass میشه یا نه:
- pass rate کمی پایین اومد: ۸۷٫۷٪ در مقابل ۸۸٫۶٪ روی Opus 5.
- ۲۷٫۵٪ خط کد کمتر برای همون taskها، و ۴۰٪ output token کمتر.
- باگهای با شدت blocker به ازای هر میلیون خط ۴۱٪ کم شد، و آسیبپذیریهای blocker ۵۳٪ کم شد.
- چگالی کلی باگ ۱۲٪ بالا رفت، و مشکلات concurrency به ازای هر میلیون خط ۴۴٪ بالا رفت.
- چگالی comment از ۱۰٫۵٪ به ۳٫۱٪ افتاد.
برداشت من: Opus 5.5 کد جمعوجورتر با اشتباههای فاجعهبار کمتر مینویسه، ولی برای هر مسئله خطهای کمتری خرج میکنه، پس باگهایی که میمونن فشردهتر کنار هم جمع میشن. عدد concurrency همونیه که من حواسم بهش هست. اگه agentهات Go با goroutine مینویسن یا هر چیزی با state مشترک، اون diffها رو از همیشه دقیقتر review کن. کم شدن commentها بعضیها رو خوشحال میکنه و بعضیها رو اذیت؛ اگه comment میخوای، حالا باید مشخصاً درخواستش کنی.
قیمت، و گیری که تو قیمته
Opus 5.5 ۴ دلار برای هر میلیون input token و ۲۰ دلار برای هر میلیون output هزینه داره، پایین از ۵ و ۲۵ دلار Opus 5. cache read از ۰٫۵۰ به ۰٫۲۰ دلار افتاد، batch نصف قیمته یعنی ۲ و ۱۰ دلار، و fast mode فقط روی Claude API با ۸ و ۴۰ دلار اجرا میشه. context window یکمیلیونی و max output ۱۲۸k تغییری نکردن.
قیمت لیست Fable 5.1 و GPT-6 Astra هر دو ۱۰ و ۵۰ دلاره، و تیترهای «۶۰٪ ارزونتر» از همینجا میان. ادعای خود Anthropic محتاطانهتره: حدود ۴۰٪ کمتر از Opus 5 روی workloadهای معمول، چون مدل برای هر task هم token کمتری مصرف میکنه. دادههای Sonar اینو تأیید میکنه.
گیرش effort هست. Opus 5.5 با همون سطح effort، تو هر turn بیشتر از Opus 5 فکر میکنه، مخصوصاً روی xhigh و max. مقایسه Kingy AI با max effort حدود ۱۱۹٬۰۰۰ output token برای هر task تخمین میزنه، در مقابل حدود ۲۷٬۰۰۰ برای Astra. من این عدد رو verify نکردم، ولی اگه حتی تقریباً درست باشه، قیمت پایینتر به ازای هر token با max effort تضمین نمیکنه صورتحسابت کمتر بشه. effort پیشفرض هم از high به medium پایین اومد، پس درخواستی که هیچوقت effort رو ست نکرده، حالا کمتر فکر میکنه، نه بیشتر. مشخصاً ستش کن و هزینه به ازای هر task رو اندازه بگیر، نه هزینه به ازای هر token.
وقتی string مدل رو عوض میکنی چی میشکنه
Opus 5 پیشفرضها رو عوض کرد. Opus 5.5 گزینهها رو حذف میکنه. راهنمای migration چهار تا breaking change رو لیست میکنه، و هرکدوم بهجای اینکه بیصدا خراب بشه یه 400 برمیگردونه، که دستکم پیدا کردنش راحته:
- thinking رو نمیشه خاموش کرد. هم
thinking: {type: "disabled"}و همbudget_tokensدستی رد میشن. حالا effort تنها اهرمه؛ هرجا قبلاً thinking رو خاموش میکردی ازlowاستفاده کن. - forced tool use دیگه نیست.
tool_choiceبا مقدارanyیاtoolرد میشه. ازautoباstrict: trueیا structured outputs استفاده کن، و اسم tool رو تو prompt بیار. - thinking blockها به مدل و گفتگو گره خوردن. روی حسابهایی که از سیویکم اوت ۲۰۲۶ به بعد ساخته شدن، replay کردن یه thinking block بعد از اینکه system prompt، toolها یا یه پیام قبلی رو ویرایش کردی، یه 400 برمیگردونه. گفتگوها رو append-only نگه دار.
- tool قدیمی
computer_20251124رد میشه، روی Claude API و Google Cloud. برو سراغcomputer_toolset_20260801. Bedrock هنوز tool قدیمی رو قبول میکنه.
یه تغییر پنجم اصلاً error نمیده، و همین باعث میشه راحتتر از همه از قلم بیفته. متن کوتاهی که مدل بین tool callها مینویسه حالا تو blockهای thinking میاد، و با تنظیم display پیشفرض، اون blockها خالیان. اگه UIـت آپدیتهای پیشرفت از نوع «الان دارم فایل config رو میخونم…» نشون میده، بدون هیچ error ساکت میشه. thinking.display رو روی "updates" (beta) بذار تا برگردن.
نکته ۳ برای fallback هم مهمه، که The New Stack تیترش کرد: “your agent calls might secretly get routed to an older model”. مکانیزمی که مستند شده اینه: Opus 5.5 حالا علاوه بر classifierهای cyber، classifierهای biology هم اجرا میکنه، و با server-side fallback فعال، یه درخواست ردشده روی یه مدل دیگه دوباره امتحان میشه. فقط Fable 5.1 و Mythos 5.1 میتونن thinking blockهای Opus 5.5 رو بخونن، پس یه fallback به هر مدل دیگهای گفتگو رو بدون reasoning قبلی ادامه میده. مستنده، و opt-in هم هست، ولی اگه fallbacks: "default" رو روی Opus 5 فعال کردی و دیگه بهش فکر نکردی، logهات رو چک کن ببینی واقعاً کدوم مدل جواب داده.
کاری که من میکنم
- تو یه dev branch به
claude-opus-5-5سوییچ میکنم و دنبال"disabled"،budget_tokensوtool_choicegrep میکنم. اونها همون 400ها هستن. effortرو همهجا مشخصاً ست میکنم. پیشفرض پایین رفت، و thinking به ازای هر سطح بالا رفت، پس هیچ تنظیمی که از قبل مونده دیگه همون معنی هفته پیش رو نمیده.- قبل از بردن ترافیک production، هزینه به ازای هر task تکمیلشده رو روی یه workload واقعی با Opus 5 مقایسه میکنم، نه هزینه به ازای هر token.
- بر اساس عددهای Sonar، یه مرحله review برای کد concurrency اضافه میکنم.
- قبل از دست زدن به هر چیزی که روی Sonnet 5 اجرا میشه، منتظر Sonnet 5.5 میمونم. اگه همین الگو رو دنبال کنه، با همین breaking changeها میاد.
مدل یه قدم واقعی به جلوئه، و حتی عددهای مستقل هم اون رو تو هر benchmark agentic در صدر یا نزدیک صدر میذارن، با قیمتی کمتر از رقباش. فقط جدول Anthropic فاصله رو بزرگتر از چیزی نشون میده که یه harness بیطرف نشون میده. برنامهت رو بر اساس «مساوی با Astra، ارزونتر، و بهتر تو knowledge work» بچین، و هر چیزی فراتر از اون رو جایزه حساب کن.
منابع: Introducing Claude Opus 5.5 (Anthropic، بیستودوم سپتامبر ۲۰۲۶)؛ What’s new in Claude Opus 5.5 و راهنمای migration (Claude Platform Docs)؛ Artificial Analysis؛ Sonar؛ VentureBeat؛ Kingy AI. این عددها روز انتشار گزارش شدن و هنوز بهصورت مستقل بازتولید نشدن.