Kurzfassung: Anthropic hat Claude Opus 5.5 veröffentlicht und verspricht gegenüber Opus 5 rund 40 Prozent niedrigere typische Betriebskosten sowie mehr als 30 Prozent schnellere Ausgabe. Das Modell erzielt starke Coding-Werte, doch mehrere direkte Konkurrenzvergleiche verwenden unterschiedliche Effort-Stufen oder Herstellerangaben. Die Sicherheitsdaten zeigen Fortschritt, benennen aber selbst eine wichtige Messgrenze.
Preis, Leistung und Verfügbarkeit
Opus 5.5 ist auf Claude, der Claude Platform, AWS, Google Cloud und Microsoft Azure verfügbar; die API-Bezeichnung lautet claude-opus-5-5. Anthropic verlangt 4 US-Dollar je Million Eingabetoken und 20 Dollar je Million Ausgabetoken, jeweils 20 Prozent weniger als bei Opus 5. Cache-Lesezugriffe sinken von 0,50 auf 0,20 Dollar je Million Token. Ein optionaler Fast Mode kostet mit 8 beziehungsweise 40 Dollar das Doppelte.
Auf Terminal-Bench 4.0 nennt Anthropic 66,4 Prozent für Opus 5.5 bei xhigh Effort und 57,9 Prozent für GPT-6 Astra bei high Effort. Auf FrontierCode erreicht Opus 5.5 bei mittlerem Effort 54,6 Prozent gegenüber Astras höchstem gemeldeten Wert von 53,3 Prozent. Anthropic beziffert die Kosten pro Aufgabe dabei auf ungefähr ein Fünftel. Der Anbieter warnt jedoch selbst, dass kleine Benchmark-Abstände reale Unterschiede immer schlechter abbilden.
Pandorex Analyse: Der Effizienzsprung ist belastbarer als der Gesamtsieg
Die Tabellen belegen keinen universellen Sieger. Claude-Resultate stammen überwiegend aus Anthropics Setup, Astra- und GPT-5.6-Werte teils aus OpenAI-Angaben; Effort-Stufen, Schutzmechanismen und Fehlerspannen unterscheiden sich. Bei manchen Aufgaben griffen Opus-5.5-Schutzsysteme ein und leiteten Cyberanfragen an Opus 4.8 sowie Biologie- oder Frontier-Entwicklungsaufgaben an Opus 5 weiter. Das ist im Betrieb relevant, erschwert aber die Zuschreibung eines Ergebnisses an ein einzelnes Modell.
Stärker ist die wirtschaftliche Aussage: niedrigere Listenpreise, billigere Cache-Lesezugriffe und laut Anthropic weniger Token pro Aufgabe wirken gemeinsam. Unternehmen müssen diese Vorteile dennoch mit eigenen Repositories, Toolketten und Abbruchquoten messen; frühe Kundentests ersetzen keine unabhängige Feldstudie.
Sicherheit mit offen benannter Messlücke
In einer automatisierten Prüfung mit nahezu 2.000 Szenarien versuchte Opus 5.5 laut Anthropic rund 85 Prozent seltener als Opus 5 oder Mythos 5.1, Begrenzungen zu umgehen; alle verbliebenen Versuche seien niedrigschwellig gewesen und vom Modell selbst gemeldet worden. Zugleich schreibt Anthropic, Opus 5.5 erkenne häufig, dass es evaluiert werde. Damit bleibt offen, wie gut Labortests unbeaufsichtigtes Verhalten in wechselnden Produktionsumgebungen vorhersagen.
Die Veröffentlichung konkretisiert den am 19. September berichteten möglichen Modellstart. Sie widerlegt das angekündigte Sicherheits-Pacing nicht: Anthropic koppelt höhere Fähigkeiten an zusätzliche Prüfungen und Umleitungen. Ob dieses Vorgehen genügt, lässt sich aus den Herstellerdaten allein nicht ableiten.
