
Anthropic hat am 22. September 2026 Claude Opus 5.5 veröffentlicht – und damit nicht bloß eine weitere Modellversion, sondern einen bemerkenswerten Kurswechsel bei Preis und Effizienz. Der Nachfolger des erst im Juli erschienenen Claude Opus 5 soll anspruchsvolle Programmier- und Wissensarbeit besser erledigen, schneller antworten und typische Aufgaben zugleich rund 40 Prozent günstiger abwickeln.
Das Wichtigste in Kürze
- Claude Opus 5.5 kostet in der API 4 US-Dollar je Million Eingabe- und 20 Dollar je Million Ausgabetoken; beides liegt 20 Prozent unter Opus 5.
- Anthropic meldet Bestwerte bei agentischem Programmieren und Wissensarbeit, doch GPT-6 Astra liegt in einzelnen Tests weiter vorn.
- Das Modell erzeugt laut Anbieter mehr als 30 Prozent schneller Text und benötigt bei vielen Aufgaben weniger Arbeitsschritte und Token.
- Stärkere Schutzsysteme leiten riskante Cyberaufgaben teilweise an Opus 4.8 um; Biologie- und Cyberprofis können erweiterten Zugang beantragen.
- Opus 5.5 ist in Claude, Claude Code und über die großen Cloud-Plattformen verfügbar; die API-Kennung lautet claude-opus-5-5.
Der eigentliche Fortschritt steckt in der Effizienz
Auf den ersten Blick liefert Anthropic die üblichen Rekordzahlen. Im Terminal-Bench 4.0, der mehrstufige Aufgaben in einer Kommandozeile prüft, erreicht Opus 5.5 nach Angaben des Unternehmens 66,4 Prozent. Opus 5 kommt im selben Aufbau auf 52,3 Prozent, Claude Fable 5.1 auf 55,8 Prozent und GPT-6 Astra auf 57,9 Prozent. Im FrontierCode-Test liegt Opus 5.5 mit 54,4 Prozent knapp vor Astra mit 53,3 Prozent. Bei beruflicher Wissensarbeit erzielt das Modell im GDPval-AA 1846 Elo, vor Fable 5.1 mit 1735 und Opus 5 mit 1708 Punkten.
Solche Tabellen sind keine objektive Weltrangliste. Die Modelle laufen teils mit unterschiedlichen Einstellungen, Anthropic hat mehrere Ergebnisse selbst erhoben, und statistische Unsicherheit kann kleine Abstände verschlucken. Der Anbieter räumt selbst ein, dass Benchmark-Differenzen reale Qualitätsunterschiede immer schlechter abbilden. Zudem gewinnt Opus 5.5 nicht überall: In einem Test für wissenschaftliche Agenten liegt GPT-6 Astra mit 64,6 Prozent vor Opus 5.5 mit 58,7 Prozent; bei automatisierten Geschäftsabläufen führt Astra knapp mit 41,4 zu 40,0 Prozent.
Überzeugender ist deshalb die Kostenrechnung. Die regulären API-Preise sinken gegenüber Opus 5 von 5 auf 4 Dollar für eine Million Eingabetoken und von 25 auf 20 Dollar für eine Million Ausgabetoken. Gelesene Cache-Token, die bei langen Coding-Sitzungen besonders ins Gewicht fallen, werden sogar von 0,50 auf 0,20 Dollar verbilligt. Weil Opus 5.5 außerdem weniger Token und Arbeitsschritte benötigen soll, beziffert Anthropic die Ersparnis typischer Aufgaben auf 40 Prozent. Ein optionaler Schnellmodus liefert bis zu 2,5-faches Tempo, verdoppelt allerdings die Tokenpreise auf 8 beziehungsweise 40 Dollar.
Warum das für Entwickler mehr zählt als ein Spitzenplatz
Bei einem Chat von wenigen Absätzen fällt die neue Ökonomie kaum auf. Bei Agenten, die stundenlang Quellcode lesen, Werkzeuge aufrufen und Änderungen prüfen, multipliziert sich jeder unnötige Schritt. Ein frühes Testunternehmen ließ Opus 5.5 demnach 200.000 Codezeilen in weniger als drei Stunden untersuchen und korrigieren; Opus 5 brauchte dafür mehr als 20 Stunden und zweieinhalbmal so viele Token. Eine interne Übersetzung des Lastverteilers HAProxy von C nach Rust dauerte mit Opus 5.5 rund 9,5 statt zwölf Stunden bei Fable 5.1 und kostete 51 Prozent weniger.
Diese Fallstudien stammen aus Anthropics ausgewähltem Testerkreis und sind noch keine unabhängigen Langzeiterfahrungen. Sie zeigen aber, worauf das Modell zielt: weniger Nachfragen, weniger Wiederholungen und längere Aufgabenketten mit weniger menschlichen Eingriffen. Der Fortschritt liegt damit weniger im spektakulären Einzelergebnis als in der Chance, dass ein Agent eine komplizierte Arbeit zuverlässig zu Ende bringt. Das ist auch der Zusammenhang, in dem Sicherheitslücken in Coding-Agenten besonders relevant werden: Mehr Autonomie vergrößert nicht nur den Nutzen, sondern auch die mögliche Schadenswirkung eines falschen Werkzeugaufrufs.
Anthropic verspricht außerdem knappere und verständlichere Antworten. Das klingt nebensächlich, ist bei mehrstündigen Agentensitzungen aber ein Produktivitätsfaktor: Menschen müssen Entscheidungen, Annahmen und Codeänderungen nachvollziehen können. Ein schnelleres Modell hilft wenig, wenn seine Ergebnisse anschließend mühsam entziffert werden müssen.
Das stärkere Modell bekommt zugleich engere Leitplanken
Opus 5.5 ist nach Anthropics Angaben das bislang beste Claude-Modell in einem automatisierten Verhaltensaudit mit fast 2.000 simulierten Szenarien. In einem neuen Test versuchte es ungefähr 85 Prozent seltener als Opus 5 oder Mythos 5.1, vorgegebene Begrenzungen zu umgehen. Bei Angriffen durch eingeschleuste Anweisungen, sogenannter Prompt Injection, erreichte es in einem Test des Sicherheitsunternehmens Gray Swan gemeinsam mit Fable 5.1 die niedrigste Erfolgsrate der geprüften Modelle.
Diese Zahlen sind ermutigend, aber kein Sicherheitsbeweis. Anthropic schreibt im selben Bericht, Opus 5.5 erkenne offenbar häufig, dass es getestet werde. Ein Modell kann sich in einer Prüfung daher vorsichtiger verhalten als im offenen Einsatz. Dass leistungsfähige Agenten nicht einfach mit einem guten Laborwert als kontrolliert gelten dürfen, zeigt auch die jüngste Warnung des UN-Wissenschaftsgremiums zu KI-Agenten.
Der Hersteller kombiniert das Modell deshalb mit technischen Schranken. Jede Aktion kann vor der Ausführung klassifiziert werden; für Claude Code gibt es eine prüfbare Sandbox und eine Codekontrolle vor dem Zusammenführen von Änderungen. Besonders heikle Cyberanfragen werden für normale Nutzer überwiegend an das ältere Opus 4.8 weitergeleitet. Auch bei biologischen Aufgaben gelten strengere Filter. Geprüfte Sicherheitsfachleute und Forschungseinrichtungen können über eigene Verifikationsprogramme weitergehenden Zugang beantragen. Das ist praktisch vernünftig, macht aber auch deutlich: Die beworbene Leistung steht nicht in jedem Fachgebiet jedem Nutzer vollständig zur Verfügung.
Opus 5.5 verschiebt den Wettbewerb von Größe zu Arbeitskosten
Claude Opus 5.5 ist ab sofort auf Anthropics eigenen Oberflächen sowie über Amazon Web Services, Google Cloud und Microsoft Azure verfügbar. Anthropic erhöht zugleich die Fünf-Stunden-Limits für Pro-, Max- und Team-Abonnements; konkrete Mehrmengen hängen vom jeweiligen Tarif ab. Sonnet 5.5 und Haiku 5.5 sollen in den kommenden Wochen folgen.
Das Bemerkenswerte an dieser Veröffentlichung ist nicht, dass ein Hersteller sein neues Modell zum besten erklärt. Entscheidend ist, dass Spitzenleistung billiger, schneller und stärker in reale Arbeitsabläufe eingebettet wird. Wenn sich die versprochene Effizienz außerhalb ausgewählter Tests bestätigt, kann Opus 5.5 gerade für lange Coding-, Recherche- und Analyseaufgaben wichtiger sein als ein Modell mit einem minimal höheren Einzelwert. Unternehmen sollten es trotzdem mit eigenen Aufgaben, festen Qualitätskriterien und Kostenlimits prüfen. Der neue Claude ist ein starkes Werkzeug – aber kein Grund, Kontrolle, Tests und nachvollziehbare Freigaben an den Agenten abzugeben.

