
Anthropic hat am 28. September Claude Sonnet 5.5 veröffentlicht. Das Modell soll bei typischer Arbeit schneller antworten und weniger Rechenaufwand benötigen, ohne dass sich der Listenpreis gegenüber Sonnet 5 ändert. Für Nutzer ist die entscheidende Frage deshalb nicht, ob eine neue Versionsnummer auf dem Auswahlknopf steht, sondern ob sich eine konkrete Aufgabe verlässlicher und mit weniger Wartezeit erledigen lässt.
Das Wichtigste in Kürze
- Sonnet 5.5 kostet in der API weiterhin zwei US-Dollar je Million Eingabetoken und zehn US-Dollar je Million Ausgabetoken.
- Anthropic meldet mehr als 30 Prozent schnellere Ausgabe und bis zu 30 Prozent niedrigere Kosten je Aufgabe in eigenen Tests.
- Ein unabhängiger CodeRabbit-Test fand bei Code-Reviews mehr erkannte Fehler, aber auch weiter deutliche Grenzen gegenüber Opus 5.5.
- Wer bestehende API-Anwendungen umstellt, muss Änderungen an Thinking, Werkzeugaufrufen und Streaming prüfen.
Was sich für den Alltag ändert
Anthropic positioniert Sonnet 5.5 für klar umrissene Alltagsaufgaben, Fehlerbehebungen sowie Dokumente, Folien und Tabellen. Opus 5.5 bleibt nach Darstellung des Unternehmens stärker, wenn eine Aufgabe über längere Zeit offenes Urteil verlangt. Dieser Unterschied ist für die Modellwahl nützlicher als eine pauschale Rangliste: Ein kleines Skript, eine erste Code-Review oder ein strukturiertes Dokument brauchen eine andere Art von Arbeit als die Architektur eines großen Systems.
Das Modell ist über Claude und die Claude API verfügbar. In der Entwicklerdokumentation stehen für Sonnet 5.5 ein Kontextfenster von einer Million Token und maximal 128.000 Ausgabetoken. Das ist eine technische Obergrenze, keine Zusage für die Antwortqualität bei sehr langen Eingaben. Wer eine lange Akte oder ein großes Repository verarbeitet, sollte prüfen, ob die relevanten Stellen tatsächlich gefunden, zitiert und richtig gewichtet werden. Ein großes Fenster ersetzt keine gute Auswahl des Materials.
Für einen praktischen Einstieg empfiehlt sich eine bekannte Aufgabe mit klar überprüfbarem Ergebnis: etwa eine kleine Änderung an einem Repository samt Tests oder eine Zusammenfassung, deren Belege sich in Originaldokumenten nachlesen lassen. Dabei sollten Nutzer dieselbe Eingabe mit dem bisher verwendeten Modell vergleichen und neben dem Ergebnis auch Laufzeit, Nacharbeit und benötigte Korrekturen festhalten. Die Einordnung des Claude-Pro-Abos hilft bei der Frage, ob die Nutzung über die App zum eigenen Arbeitsmuster passt; API-Preise sind davon getrennt.
Warum der gleiche Tokenpreis weniger Kosten bedeuten kann
Anthropic verlangt für Sonnet 5.5 dieselben zwei beziehungsweise zehn US-Dollar je Million Ein- und Ausgabetoken wie für Sonnet 5. Cache-Lesezugriffe kosten laut Hersteller 20 Cent je Million Token. Wenn ein Modell dieselbe Aufgabe mit weniger Zwischenschritten und kürzeren Antworten erledigt, sinkt die Rechnung pro Aufgabe trotz unveränderter Tarife. Anthropic beziffert den Vorteil in eigenen Tests auf bis zu 30 Prozent und nennt eine um mehr als 30 Prozent höhere Ausgabegeschwindigkeit. Diese Werte gelten nicht automatisch für jede Anwendung.
CodeRabbit hat die beiden Sonnet-Versionen in seiner Review-Pipeline verglichen. Bei 13 schwierigen Fällen mit bekannten Fehlern markierte Sonnet 5.5 sechs Probleme in verwertbaren Kommentaren, Sonnet 5 vier. Bei 44 Open-Source-Pull-Requests lag die durchschnittliche Review-Zeit nach CodeRabbits Messung bei 6 Minuten und 33 Sekunden statt 13 Minuten und 31 Sekunden. Die reinen Claude-Modellaufrufe kosteten dort nach Listenpreisen etwa 46 statt 116 US-Cent je Review. Das ist ein Befund für genau diese Pipeline, kein allgemeiner Rabatt für alle Kunden.
Der Test nennt selbst wichtige Grenzen: 13 schwierige Fälle sind eine kleine Stichprobe, und für den größeren Satz war die Bewertung der Fehlerabdeckung bei Veröffentlichung noch offen. Sonnet 5.5 übersah zudem zwei Fehler, die Sonnet 5 fand. Für riskante Änderungen schnitt Opus 5.5 auf denselben schwierigen Fällen besser ab. Ein Team, das automatisierte Reviews einsetzt, sollte daher nicht nur die Anzahl der Kommentare zählen, sondern prüfen, welche echten Probleme das Modell entdeckt und welche es übersieht.
Benchmarks und Umstellung richtig lesen
Anthropic meldet für Sonnet 5.5 im agentischen Coding-Test Terminal-Bench 4.0 einen Wert von 70,6 Prozent; Sonnet 5 wird mit 10,3 Prozent angegeben. Die große Differenz ist bemerkenswert, aber sie stammt aus einer definierten Testkonfiguration. Sie beweist weder eine entsprechende Steigerung in jedem eigenen Projekt noch eine generelle Überlegenheit gegenüber anderen Modellen. Wer die Werte für eine Beschaffung verwendet, muss Testumgebung, eingestellten Aufwand und tatsächliche Kosten pro gelöster Aufgabe gemeinsam betrachten.
Auch technisch ist ein Modellwechsel mehr als ein neuer Name im API-Aufruf. Anthropic dokumentiert Änderungen beim adaptiven Nachdenken, bei erzwungenen Werkzeugaufrufen und bei der Darstellung von Text zwischen Werkzeugaufrufen im Stream. Eine Anwendung, die solche Ausgaben direkt an Nutzer weiterreicht, kann sich nach der Umstellung sichtbar anders verhalten. Deshalb gehört ein Test der eigenen Prompt- und Werkzeugkette zur Migration, insbesondere wenn eine Antwort live gestreamt oder ein Agent mit mehreren Werkzeugen betrieben wird.
Was jetzt zählt
Sonnet 5.5 bietet eine plausible Option für häufige, gut definierte Arbeit: gleicher Tokenpreis, laut Hersteller höheres Tempo und in einer unabhängigen Review-Pipeline weniger Kosten pro fertiger Prüfung. Die entscheidende Messgröße bleibt aber das eigene Ergebnis. Ein sinnvoller Pilot nutzt echte Aufgaben mit bekannten Sollwerten, misst die vollständigen Kosten einschließlich Nacharbeit und hält Fehlgriffe fest. So lässt sich beurteilen, ob die neue Effizienz im eigenen Alltag ankommt, ohne Benchmarkwerte mit einer Garantie zu verwechseln.

