Opus 5.5 با ۴۰٪ قیمت Fable 5.1 ازش جلو می‌زنه. جدول benchmark رو دوبار بخون.

ai llm anthropic claude opus benchmarks

Anthropic امروز، بیست‌ودوم سپتامبر ۲۰۲۶، Opus 5.5 رو منتشر کرد. دو ماه پیش نوشتم که داستان اصلی Opus 5 تغییرات API بود، نه benchmarkها. این بار benchmarkها ارزش یه نگاه دقیق‌تر رو دارن، تا حدی چون بزرگن و تا حدی چون اولین اجرای مستقل همین الان با یکی‌شون مخالفه.

اول یه چیز، چون دنبالش گشتم: هنوز Sonnet 5.5 نداریم. اعلامیه می‌گه Sonnet 5.5 و Haiku 5.5 «تو هفته‌های بعد» با بهبودهای مشابه میان. پس این پست فقط درباره Opus 5.5 هست، و Sonnet 5 هنوز Sonnet فعلیه.

انتخاب سریع

اگه تو…انتخابچرا
sessionهای طولانی agentic coding اجرا می‌کنیOpus 5.5تو همه جدول‌ها، از جمله جدول مستقل، تو Terminal-Bench 4.0 و FrontierCode اوله
برای کار coding قیمت Fable 5.1 رو می‌دیOpus 5.5امتیاز بالاتر با $4/$20 در مقابل $10/$50 مال Fable
کار agentic علمی یا اتوماسیون workflowهای SaaS می‌کنیGPT-6 Astra رو هم تست کنAstra تو Terminal-Bench-Science و AutomationBench اوله
به thinking: disabled یا forced tool use تکیه داریتا migrate نکردی رو Opus 5 بمونهر دو حالا 400 برمی‌گردونن
منتظر یه ارتقای ارزون‌تر تو رده میانی هستیفعلاً Sonnet 5Sonnet 5.5 اعلام شده، منتشر نشده

جدول Anthropic

این مقایسه کامل از صفحه معرفی هست:

BenchmarkOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%n/a41.7%
GDPval-AA v2.1 (Elo)18461735170815421588
AutomationBench40.0%31.4%26.9%41.4%28.8%
Humanity’s Last Exam (tools)67.7%65.6%63.6%57.2%n/a
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
OSWorld 2.0 (partial)81.8%80.7%74.0%n/an/a
Chartography (tools)89.0%88.4%83.4%n/an/a

تیتر اصلی ردیف اوله. Terminal-Bench یه agent رو اندازه می‌گیره که تو یه shell واقعی روی taskهای چندمرحله‌ای کار می‌کنه، که نزدیک‌ترین benchmark عمومی به کاریه که من واقعاً کل روز با این مدل‌ها می‌کنم. یه جهش از ۵۲٫۳٪ به ۶۶٫۴٪ تو دو ماه، و ۱۰ امتیاز جلوتر از Fable 5.1، بزرگ‌ترین پیشرفت یه release تنها روی این benchmark می‌شه که تا حالا دیدم.

GDPval-AA اون یکی عدد بزرگه. خروجی‌های حرفه‌ای (گزارش، spreadsheet، تحلیل) رو رودررو امتیاز می‌ده و یه رتبه Elo گزارش می‌کنه. فاصله ۳۰۰ امتیازی با GPT-6 Astra یعنی Opus 5.5 بیشتر مقایسه‌های مستقیم رو می‌بره، نه فقط چندتاشون رو.

دو تا ردیف برعکسه، و Anthropic با این حال چاپشون کرد، که ازش خوشم میاد. Astra تو AutomationBench (workflowهای business روی ابزارهای SaaS) با ۱٫۴ امتیاز جلوئه، فاصله‌ای کوچیک‌تر از اون‌که مهم باشه. تو Terminal-Bench-Science حدود ۶ امتیاز جلوئه، که اگه agentهات کار scientific computing می‌کنن، واقعاً مهمه.

اجرای مستقل کوچیک‌تره

Artificial Analysis همون روز ارزیابی‌های خودش رو اجرا کرد. خلاصه‌شون: Opus 5.5 با max effort تو Intelligence Index اونا ۵۸ می‌گیره، بالاترین عددی که تا حالا اندازه گرفتن «با چند امتیاز فاصله»، و تو شش تا از ده ارزیابی جزئی‌شون اوله.

ولی امتیاز Terminal-Bench 4.0 اونا ۵۹٫۶٪ هست، نه ۶۶٫۴٪. این هنوز ۱۱ امتیاز بالاتر از Opus 5 هست، و با GPT-6 Astra با effort xhigh مساویه. چیزی که نشون نمی‌ده یه فاصله ۱۰ امتیازیه. عدد Humanity’s Last Exam اونا ۶۱٫۴٪ هست در مقابل ۶۷٫۷٪ مال Anthropic، هرچند این فاصله دست‌کم تا حدی به‌خاطر اینه که دو تا اجرا setup متفاوتی برای toolها دارن.

این عادیه. vendorها harness، سطح effort و budget مربوط به timeout رو tune می‌کنن، و ارزیاب‌های مستقل برای همه مدل‌ها از یه harness استاندارد استفاده می‌کنن. هیچ‌کدوم از این دو عدد غلط نیست. دارن چیزهای متفاوتی رو اندازه می‌گیرن: عدد Anthropic نشون می‌ده مدل تو یه setup که براش ساخته شده چی کار می‌تونه بکنه، و Artificial Analysis نشون می‌ده تو شرایط یکسان با بقیه چطور مقایسه می‌شه. اگه برای terminal agentها داری بین Opus 5.5 و Astra انتخاب می‌کنی، خلاصه صادقانه اینه: «مساوی، با قیمت کمتر». این هنوزم نتیجه خوبیه.

کد کمتر، نه همیشه کد بهتر

Sonar ارزیابی کیفیت کد خودش رو روی ۴٬۴۴۴ تا task جاوا از HumanEval، MBPP و ComplexCodeEval اجرا کرد و Opus 5.5 رو با Opus 5 مقایسه کرد. این جالب‌ترین داده روز انتشاره، چون اندازه می‌گیره کد چه شکلیه، نه فقط این‌که pass می‌شه یا نه:

  • pass rate کمی پایین اومد: ۸۷٫۷٪ در مقابل ۸۸٫۶٪ روی Opus 5.
  • ۲۷٫۵٪ خط کد کمتر برای همون taskها، و ۴۰٪ output token کمتر.
  • باگ‌های با شدت blocker به ازای هر میلیون خط ۴۱٪ کم شد، و آسیب‌پذیری‌های blocker ۵۳٪ کم شد.
  • چگالی کلی باگ ۱۲٪ بالا رفت، و مشکلات concurrency به ازای هر میلیون خط ۴۴٪ بالا رفت.
  • چگالی comment از ۱۰٫۵٪ به ۳٫۱٪ افتاد.

برداشت من: Opus 5.5 کد جمع‌وجورتر با اشتباه‌های فاجعه‌بار کمتر می‌نویسه، ولی برای هر مسئله خط‌های کمتری خرج می‌کنه، پس باگ‌هایی که می‌مونن فشرده‌تر کنار هم جمع می‌شن. عدد concurrency همونیه که من حواسم بهش هست. اگه agentهات Go با goroutine می‌نویسن یا هر چیزی با state مشترک، اون diffها رو از همیشه دقیق‌تر review کن. کم شدن commentها بعضی‌ها رو خوشحال می‌کنه و بعضی‌ها رو اذیت؛ اگه comment می‌خوای، حالا باید مشخصاً درخواستش کنی.

قیمت، و گیری که تو قیمته

Opus 5.5 ۴ دلار برای هر میلیون input token و ۲۰ دلار برای هر میلیون output هزینه داره، پایین از ۵ و ۲۵ دلار Opus 5. cache read از ۰٫۵۰ به ۰٫۲۰ دلار افتاد، batch نصف قیمته یعنی ۲ و ۱۰ دلار، و fast mode فقط روی Claude API با ۸ و ۴۰ دلار اجرا می‌شه. context window یک‌میلیونی و max output ۱۲۸k تغییری نکردن.

قیمت لیست Fable 5.1 و GPT-6 Astra هر دو ۱۰ و ۵۰ دلاره، و تیترهای «۶۰٪ ارزون‌تر» از همین‌جا میان. ادعای خود Anthropic محتاطانه‌تره: حدود ۴۰٪ کمتر از Opus 5 روی workloadهای معمول، چون مدل برای هر task هم token کمتری مصرف می‌کنه. داده‌های Sonar اینو تأیید می‌کنه.

گیرش effort هست. Opus 5.5 با همون سطح effort، تو هر turn بیشتر از Opus 5 فکر می‌کنه، مخصوصاً روی xhigh و max. مقایسه Kingy AI با max effort حدود ۱۱۹٬۰۰۰ output token برای هر task تخمین می‌زنه، در مقابل حدود ۲۷٬۰۰۰ برای Astra. من این عدد رو verify نکردم، ولی اگه حتی تقریباً درست باشه، قیمت پایین‌تر به ازای هر token با max effort تضمین نمی‌کنه صورت‌حسابت کمتر بشه. effort پیش‌فرض هم از high به medium پایین اومد، پس درخواستی که هیچ‌وقت effort رو ست نکرده، حالا کمتر فکر می‌کنه، نه بیشتر. مشخصاً ستش کن و هزینه به ازای هر task رو اندازه بگیر، نه هزینه به ازای هر token.

وقتی string مدل رو عوض می‌کنی چی می‌شکنه

Opus 5 پیش‌فرض‌ها رو عوض کرد. Opus 5.5 گزینه‌ها رو حذف می‌کنه. راهنمای migration چهار تا breaking change رو لیست می‌کنه، و هرکدوم به‌جای این‌که بی‌صدا خراب بشه یه 400 برمی‌گردونه، که دست‌کم پیدا کردنش راحته:

  1. thinking رو نمی‌شه خاموش کرد. هم thinking: {type: "disabled"} و هم budget_tokens دستی رد می‌شن. حالا effort تنها اهرمه؛ هرجا قبلاً thinking رو خاموش می‌کردی از low استفاده کن.
  2. forced tool use دیگه نیست. tool_choice با مقدار any یا tool رد می‌شه. از auto با strict: true یا structured outputs استفاده کن، و اسم tool رو تو prompt بیار.
  3. thinking blockها به مدل و گفتگو گره خوردن. روی حساب‌هایی که از سی‌ویکم اوت ۲۰۲۶ به بعد ساخته شدن، replay کردن یه thinking block بعد از این‌که system prompt، toolها یا یه پیام قبلی رو ویرایش کردی، یه 400 برمی‌گردونه. گفتگوها رو append-only نگه دار.
  4. tool قدیمی computer_20251124 رد می‌شه، روی Claude API و Google Cloud. برو سراغ computer_toolset_20260801. Bedrock هنوز tool قدیمی رو قبول می‌کنه.

یه تغییر پنجم اصلاً error نمی‌ده، و همین باعث می‌شه راحت‌تر از همه از قلم بیفته. متن کوتاهی که مدل بین tool callها می‌نویسه حالا تو blockهای thinking میاد، و با تنظیم display پیش‌فرض، اون blockها خالی‌ان. اگه UIـت آپدیت‌های پیشرفت از نوع «الان دارم فایل config رو می‌خونم…» نشون می‌ده، بدون هیچ error ساکت می‌شه. thinking.display رو روی "updates" (beta) بذار تا برگردن.

نکته ۳ برای fallback هم مهمه، که The New Stack تیترش کرد: “your agent calls might secretly get routed to an older model”. مکانیزمی که مستند شده اینه: Opus 5.5 حالا علاوه بر classifierهای cyber، classifierهای biology هم اجرا می‌کنه، و با server-side fallback فعال، یه درخواست ردشده روی یه مدل دیگه دوباره امتحان می‌شه. فقط Fable 5.1 و Mythos 5.1 می‌تونن thinking blockهای Opus 5.5 رو بخونن، پس یه fallback به هر مدل دیگه‌ای گفتگو رو بدون reasoning قبلی ادامه می‌ده. مستنده، و opt-in هم هست، ولی اگه fallbacks: "default" رو روی Opus 5 فعال کردی و دیگه بهش فکر نکردی، logهات رو چک کن ببینی واقعاً کدوم مدل جواب داده.

کاری که من می‌کنم

  1. تو یه dev branch به claude-opus-5-5 سوییچ می‌کنم و دنبال "disabled"، budget_tokens و tool_choice grep می‌کنم. اون‌ها همون 400ها هستن.
  2. effort رو همه‌جا مشخصاً ست می‌کنم. پیش‌فرض پایین رفت، و thinking به ازای هر سطح بالا رفت، پس هیچ تنظیمی که از قبل مونده دیگه همون معنی هفته پیش رو نمی‌ده.
  3. قبل از بردن ترافیک production، هزینه به ازای هر task تکمیل‌شده رو روی یه workload واقعی با Opus 5 مقایسه می‌کنم، نه هزینه به ازای هر token.
  4. بر اساس عددهای Sonar، یه مرحله review برای کد concurrency اضافه می‌کنم.
  5. قبل از دست زدن به هر چیزی که روی Sonnet 5 اجرا می‌شه، منتظر Sonnet 5.5 می‌مونم. اگه همین الگو رو دنبال کنه، با همین breaking changeها میاد.

مدل یه قدم واقعی به جلوئه، و حتی عددهای مستقل هم اون رو تو هر benchmark agentic در صدر یا نزدیک صدر می‌ذارن، با قیمتی کمتر از رقباش. فقط جدول Anthropic فاصله رو بزرگ‌تر از چیزی نشون می‌ده که یه harness بی‌طرف نشون می‌ده. برنامه‌ت رو بر اساس «مساوی با Astra، ارزون‌تر، و بهتر تو knowledge work» بچین، و هر چیزی فراتر از اون رو جایزه حساب کن.


منابع: Introducing Claude Opus 5.5 (Anthropic، بیست‌ودوم سپتامبر ۲۰۲۶)؛ What’s new in Claude Opus 5.5 و راهنمای migration (Claude Platform Docs)؛ Artificial Analysis؛ Sonar؛ VentureBeat؛ Kingy AI. این عددها روز انتشار گزارش شدن و هنوز به‌صورت مستقل بازتولید نشدن.

$ cat AI .md
· 9 دقیقه مطالعه

Opus 5 اومد، با نصف قیمت Fable 5. benchmarkها عالی‌ان، ولی داستان اصلی تغییرات API هست.

Opus 5 بیست‌وچهارم ژوئیه به‌عنوان مدل پیش‌فرض جدید Anthropic عرضه شد. جدول benchmark با نصف هزینه، فقط یه گِرد کردن رقم با Fable 5 فاصله داره. ولی چیزی که واقعاً روزت رو عوض می‌کنه آروم‌تره: حالا thinking به‌صورت پیش‌فرض روشنه، و این چند تا فرضی که از زمان 4.8 با خودت حمل می‌کردی رو به‌هم می‌ریزه.

ai llm anthropic claude opus
$ cat AI .md
· 17 دقیقه مطالعه

Sonnet 5 اومد. من پرسیدم چی عوض شده. این چیزیه که فهمیدم.

می‌خواستم بفهمم بین Sonnet 5 و Sonnet 4.6 از نظر معماری چی عوض شده. Anthropic چیزی نمیگه. برای همین system card صد و چهل و شش صفحه‌ای رو خوندم و در نهایت یه راهنمای ساده از همه benchmarkهاش نوشتم.

ai llm anthropic claude benchmarks