Opus 5.5 schlägt Fable 5.1 für 40% des Preises. Lies die Benchmark-Tabelle zweimal.

ai llm anthropic claude opus benchmarks

Anthropic hat heute, am 22. September 2026, Opus 5.5 veröffentlicht. Vor zwei Monaten habe ich geschrieben, dass die eigentliche Geschichte bei Opus 5 die API-Änderungen waren, nicht die Benchmarks. Diesmal lohnt sich ein genauerer Blick auf die Benchmarks, zum Teil weil sie groß sind und zum Teil weil der erste unabhängige Lauf einem davon schon widerspricht.

Eins vorweg, weil ich extra danach gesucht habe: Es gibt noch kein Sonnet 5.5. Laut Ankündigung folgen Sonnet 5.5 und Haiku 5.5 “in den kommenden Wochen” mit ähnlichen Verbesserungen. In diesem Post geht es also nur um Opus 5.5, und Sonnet 5 ist weiterhin das aktuelle Sonnet.

Kurzempfehlungen

Wenn du…WahlWarum
lange agentische Coding-Sessions fährstOpus 5.5Führt Terminal-Bench 4.0 und FrontierCode in jeder Tabelle an, auch in der unabhängigen
für Coding-Arbeit Fable-5.1-Preise zahlstOpus 5.5Höhere Scores für $4/$20 gegenüber Fables $10/$50
agentische Wissenschaft oder SaaS-Workflow-Automatisierung machstTeste auch GPT-6 AstraAstra führt bei Terminal-Bench-Science und AutomationBench
dich auf thinking: disabled oder erzwungene Tool-Nutzung verlässtBleib bei Opus 5, bis du migriert hastBeides liefert jetzt einen 400
auf ein günstigeres Mid-Tier-Upgrade wartestVorerst Sonnet 5Sonnet 5.5 ist angekündigt, nicht veröffentlicht

Anthropics Tabelle

Hier der komplette Vergleich von der Launch-Seite:

BenchmarkOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066.4%55.8%52.3%57.9%37.3%
FrontierCode v1.1 (Main)54.4%50.3%48.0%53.3%47.5%
CursorBench 4.057.8%51.8%46.6%n/a41.7%
GDPval-AA v2.1 (Elo)18461735170815421588
AutomationBench40.0%31.4%26.9%41.4%28.8%
Humanity’s Last Exam (tools)67.7%65.6%63.6%57.2%n/a
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%22.4%
OSWorld 2.0 (partial)81.8%80.7%74.0%n/an/a
Chartography (tools)89.0%88.4%83.4%n/an/a

Die Schlagzeile steckt in der ersten Zeile. Terminal-Bench misst einen Agenten, der in einer echten Shell an mehrstufigen Aufgaben arbeitet, und ist damit der öffentliche Benchmark, der dem am nächsten kommt, was ich den ganzen Tag mit diesen Modellen mache. Ein Sprung von 52,3% auf 66,4% in zwei Monaten und 10 Punkte Vorsprung auf Fable 5.1 wären der größte Zuwachs durch ein einzelnes Release, den ich bei diesem Benchmark gesehen habe.

GDPval-AA ist die andere große Zahl. Der Benchmark bewertet professionelle Arbeitsergebnisse (Reports, Spreadsheets, Analysen) im direkten Vergleich und gibt ein Elo-Rating aus. 300 Punkte Abstand zu GPT-6 Astra heißen, dass Opus 5.5 die meisten direkten Vergleiche gewinnt, nicht nur ein paar.

Zwei Zeilen gehen in die andere Richtung, und Anthropic hat sie trotzdem abgedruckt, was ich zu schätzen weiß. Astra führt bei AutomationBench (Business-Workflows über SaaS-Tools hinweg) mit 1,4 Punkten, ein Abstand, der zu klein ist, um eine Rolle zu spielen. Bei Terminal-Bench-Science führt Astra mit etwa 6 Punkten, und das spielt sehr wohl eine Rolle, wenn deine Agenten wissenschaftliches Rechnen machen.

Der unabhängige Lauf fällt kleiner aus

Artificial Analysis hat am selben Tag eigene Evaluierungen laufen lassen. Ihre Zusammenfassung: Opus 5.5 erreicht bei max Effort 58 Punkte auf ihrem Intelligence Index, der höchste Wert, den sie je gemessen haben, und das “mit mehreren Punkten Abstand”, und es führt sechs ihrer zehn Einzel-Evaluierungen an.

Aber ihr Terminal-Bench-4.0-Score liegt bei 59,6%, nicht bei 66,4%. Das sind immer noch 11 Punkte mehr als Opus 5, und es liegt gleichauf mit GPT-6 Astra bei xhigh Effort. Was es nicht zeigt, ist ein Vorsprung von 10 Punkten. Ihr Wert für Humanity’s Last Exam liegt bei 61,4% gegenüber Anthropics 67,7%, wobei dieser Abstand zumindest teilweise daher kommt, dass die beiden Läufe unterschiedliche Tool-Setups verwenden.

Das ist normal. Hersteller tunen die Harness, das Effort-Level und das Timeout-Budget, und unabhängige Evaluatoren nutzen eine einheitliche Harness für jedes Modell. Keine der beiden Zahlen ist falsch. Sie messen verschiedene Dinge: Anthropics Zahl zeigt, was das Modell in einem Setup kann, das dafür gebaut wurde, und Artificial Analysis zeigt, wie es sich unter identischen Bedingungen mit allem anderen vergleicht. Wenn du für Terminal-Agenten zwischen Opus 5.5 und Astra wählst, ist “gleichauf, zu einem niedrigeren Preis” die ehrliche Zusammenfassung. Das ist trotzdem ein gutes Ergebnis.

Weniger Code, nicht immer besserer Code

Sonar hat seine Code-Qualitäts-Evaluierung über 4.444 Java-Aufgaben aus HumanEval, MBPP und ComplexCodeEval laufen lassen und Opus 5.5 mit Opus 5 verglichen. Das sind die interessantesten Daten vom Launch-Tag, weil sie messen, wie der Code aussieht, nicht nur, ob er durchläuft:

  • Die Pass-Rate ist leicht gesunken: 87,7% gegenüber 88,6% bei Opus 5.
  • 27,5% weniger Codezeilen für dieselben Aufgaben und 40% weniger Output-Tokens.
  • Bugs mit Schweregrad Blocker sind um 41% gesunken pro Million Zeilen, Blocker-Schwachstellen um 53%.
  • Die Bug-Dichte insgesamt ist um 12% gestiegen, und Concurrency-Probleme sind um 44% gestiegen pro Million Zeilen.
  • Die Kommentardichte ist von 10,5% auf 3,1% gefallen.

Meine Lesart: Opus 5.5 schreibt kompakteren Code mit weniger katastrophalen Fehlern, aber es verwendet weniger Zeilen pro Problem, also liegen die verbleibenden Bugs dichter beieinander. Die Concurrency-Zahl ist die, die ich im Auge behalten würde. Wenn deine Agenten Go mit Goroutines schreiben oder irgendetwas mit Shared State, schau dir diese Diffs genauer an als sonst. Der Rückgang bei den Kommentaren wird manche freuen und andere nerven; wenn du Kommentare willst, musst du jetzt explizit danach fragen.

Der Preis, und der Haken am Preis

Opus 5.5 kostet $4 pro Million Input-Tokens und $20 pro Million Output, runter von Opus 5s $5/$25. Cache Reads sind von $0,50 auf $0,20 gefallen, Batch kostet die Hälfte mit $2/$10, und der Fast Mode läuft für $8/$40, nur auf der Claude API. Das 1M-Kontextfenster und die 128k maximaler Output bleiben unverändert.

Fable 5.1 und GPT-6 Astra stehen beide bei $10/$50 auf der Preisliste, und daher kommen die “60% günstiger”-Schlagzeilen. Anthropics eigene Aussage ist vorsichtiger: etwa 40% weniger als Opus 5 bei typischen Workloads, weil das Modell auch weniger Tokens pro Aufgabe verbraucht. Die Sonar-Daten stützen das.

Der Haken ist Effort. Opus 5.5 denkt pro Turn mehr als Opus 5 beim selben Effort-Level, am stärksten bei xhigh und max. Der Vergleich von Kingy AI schätzt rund 119.000 Output-Tokens pro Aufgabe bei max Effort, gegenüber rund 27.000 bei Astra. Ich habe diese Zahl nicht überprüft, aber wenn sie auch nur ungefähr stimmt, garantiert ein niedrigerer Preis pro Token keine niedrigere Rechnung bei max Effort. Außerdem ist der Default-Effort von high auf medium gesunken, also denkt eine Anfrage, die nie effort gesetzt hat, jetzt weniger, nicht mehr. Setz es explizit und miss die Kosten pro Aufgabe, nicht die Kosten pro Token.

Was kaputtgeht, wenn du den Modell-String tauschst

Opus 5 hat Defaults geändert. Opus 5.5 entfernt Optionen. Der Migration Guide listet vier Breaking Changes auf, und jede davon liefert einen 400, statt still zu scheitern, was sie zumindest leicht zu erkennen macht:

  1. Thinking lässt sich nicht abschalten. Sowohl thinking: {type: "disabled"} als auch manuelle budget_tokens werden abgelehnt. Effort ist jetzt die einzige Stellschraube; nimm low, wo du Thinking früher abgeschaltet hast.
  2. Erzwungene Tool-Nutzung ist weg. tool_choice mit any oder tool wird abgelehnt. Nimm auto mit strict: true oder Structured Outputs und nenn das Tool im Prompt.
  3. Thinking-Blöcke sind an das Modell und das Gespräch gebunden. Bei Accounts, die am oder nach dem 31. August 2026 angelegt wurden, liefert das erneute Abspielen eines Thinking-Blocks einen 400, wenn du den System-Prompt, die Tools oder eine frühere Nachricht bearbeitet hast. Halte Gespräche append-only.
  4. Das alte Tool computer_20251124 wird abgelehnt, auf der Claude API und auf Google Cloud. Steig auf computer_toolset_20260801 um. Bedrock akzeptiert das alte Tool noch.

Eine fünfte Änderung wirft überhaupt keinen Fehler, und deshalb übersieht man sie am leichtesten. Der kurze Text, den das Modell zwischen Tool-Calls schreibt, kommt jetzt in thinking-Blöcken an, und bei der Standard-Anzeigeeinstellung sind diese Blöcke leer. Wenn deine UI Fortschrittsmeldungen im Stil von “lese jetzt die Config-Datei…” anzeigt, wird sie ohne Fehler verstummen. Setz thinking.display auf "updates" (Beta), um sie zurückzubekommen.

Punkt 3 ist auch für Fallback wichtig, was The New Stack mit “your agent calls might secretly get routed to an older model” getitelt hat. Der dokumentierte Mechanismus sieht so aus: Opus 5.5 lässt jetzt zusätzlich zu den Cyber-Classifiern auch Biologie-Classifier laufen, und mit aktiviertem serverseitigem Fallback wird eine abgelehnte Anfrage auf einem anderen Modell wiederholt. Nur Fable 5.1 und Mythos 5.1 können die Thinking-Blöcke von Opus 5.5 lesen, also setzt ein Fallback auf irgendein anderes Modell das Gespräch ohne das vorherige Reasoning fort. Das ist dokumentiert, und es ist opt-in, aber wenn du auf Opus 5 fallbacks: "default" aktiviert und nie wieder darüber nachgedacht hast, schau in deinen Logs nach, welches Modell tatsächlich geantwortet hat.

Was ich mache

  1. Auf einem Dev-Branch auf claude-opus-5-5 umstellen und nach "disabled", budget_tokens und tool_choice greppen. Das sind die 400er.
  2. effort überall explizit setzen. Der Default ist nach unten gewandert und das Thinking pro Level nach oben, also bedeutet keine übernommene Einstellung mehr dasselbe wie letzte Woche.
  3. Bevor ich Produktions-Traffic umstelle, die Kosten pro erledigter Aufgabe mit Opus 5 auf einem echten Workload vergleichen, nicht die Kosten pro Token.
  4. Wegen der Sonar-Zahlen einen Review-Schritt für Concurrency-Code einbauen.
  5. Auf Sonnet 5.5 warten, bevor ich irgendetwas anfasse, das auf Sonnet 5 läuft. Wenn es demselben Muster folgt, kommt es mit denselben Breaking Changes.

Das Modell ist ein echter Fortschritt, und selbst die unabhängigen Zahlen sehen es bei jedem agentischen Benchmark an oder nahe der Spitze, zu einem niedrigeren Preis als die Konkurrenz. Anthropics Tabelle lässt den Vorsprung nur größer aussehen als eine neutrale Harness. Plan mit “gleichauf mit Astra, günstiger und besser bei Wissensarbeit”, und betrachte alles darüber hinaus als Bonus.


Quellen: Introducing Claude Opus 5.5 (Anthropic, 22. September 2026); What’s new in Claude Opus 5.5 und der Migration Guide (Claude Platform Docs); Artificial Analysis; Sonar; VentureBeat; Kingy AI. Die Zahlen wurden am Launch-Tag berichtet und sind nicht unabhängig reproduziert.

$ cat AI .md
· 9 Min. Lesezeit

Opus 5 ist da, zum halben Preis von Fable 5. Die Benchmarks sind stark, aber die eigentliche Geschichte sind die API-Änderungen.

Opus 5 wurde am 24. Juli als Anthropics neues Standardmodell ausgeliefert. Die Benchmark-Tabelle liegt bei halben Kosten nur eine Rundungsstelle hinter Fable 5. Aber das, was deinen Alltag wirklich verändert, ist leiser: Thinking ist jetzt standardmäßig an, und das kippt ein paar Annahmen, die du seit 4.8 mit dir herumträgst.

ai llm anthropic claude opus