Auf dem Preisschild hat sich nichts verändert: Eine Million eingegebene Token kostet zwei Dollar, eine Million ausgegebene zehn Dollar. Claude Sonnet 5.5 ist damit nominell genauso teuer wie sein Vorgänger. Trotzdem verspricht Anthropic, das am 28. September 2026 veröffentlichte Modell erledige viele Aufgaben bis zu 30 Prozent günstiger und erzeuge seine Antworten mehr als 30 Prozent schneller. Derselbe Tarif, eine kleinere Rechnung – so lautet die Botschaft. Recherchequelle: anthropic.com
Der Fall steht für einen Wandel, der weit über dieses Modell hinausreicht. Bislang werden KI-Modelle häufig wie Rohstoffe verglichen: so viele Dollar pro Million Token, so groß das Kontextfenster, so schnell die Ausgabe. Doch dieser Vergleich bekommt Risse. Nutzer kaufen schließlich keine Token. Sie wollen einen Fehler im Programm finden, eine Tabelle bereinigen, einen Bericht schreiben oder einen Vorgang prüfen lassen.
Entscheidend ist deshalb nicht mehr allein der Preis eines einzelnen Rechenschritts. Ebenso wichtig ist, wie viele solcher Schritte die Maschine braucht, bis die Arbeit wirklich erledigt ist.
Die Rechnung hinter der Rechnung
Ein Token ist ein kleines Textstück. Manche Wörter bestehen aus einem einzigen Token, andere werden in mehrere Teile zerlegt. Wer ein Modell über eine Programmierschnittstelle nutzt, bezahlt gewöhnlich sowohl für die Eingabe als auch für die erzeugte Ausgabe. Das bleibt übersichtlich, solange die Antwort nur aus einigen Absätzen besteht.
Komplizierter wird es, sobald die KI selbstständig Dateien liest, Programme ausführt, Suchwerkzeuge aufruft, Zwischenergebnisse prüft und einen Fehler nach dem nächsten korrigiert. Dann gleicht die Rechnung einem Taxameter: Nicht nur das Ziel zählt, sondern auch jeder Umweg dorthin.
Sonnet 5.5 besitzt fünf Leistungsstufen von „low“ bis „max“. In den Claude-Anwendungen ist die mittlere Stufe voreingestellt, auf der Entwicklerplattform dagegen „high“. Je höher die Einstellung, desto länger kann das Modell nachdenken und desto gründlicher soll es arbeiten. Zugleich steigen Tokenverbrauch, Laufzeit und Kosten. Anthropics eigene Messungen zeigen, dass Sonnet 5.5 bei niedriger oder mittlerer Einstellung in mehreren Benchmarks Ergebnisse auf dem Niveau der besten Resultate des Vorgängers erreicht – für ungefähr ein Zehntel der Kosten. Im Wissensarbeitsbenchmark AA-Briefcase übertraf die mittlere Stufe den Bestwert von Sonnet 5 und kostete pro Aufgabe nur etwa ein Neuntel des Preises.
Das klingt nach einem klaren Effizienzsprung – allerdings nur, bis man den Regler ganz nach rechts schiebt.
Wenn mehr Denken die Rechnung aufbläht
Artificial Analysis ließ Sonnet 5.5 in einem eigenen Modellvergleich mit maximaler Rechenintensität antreten. Das Ergebnis war technisch beeindruckend: Mit 56 Punkten im Intelligence Index lag das Modell nur knapp hinter Claude Opus 5.5. Dafür erzeugte es allerdings rund 193.000 Ausgabetoken pro Testaufgabe. Einen derart hohen Verbrauch hatte Artificial Analysis bis dahin nicht gemessen. Er lag rund 60 Prozent über dem von Opus 5.5 und war ungefähr siebenmal so hoch wie der von GPT-6 Astra, jeweils bezogen auf die verglichene Konfiguration.
Trotz des niedrigeren Tokenpreises kostete eine Aufgabe damit rund 7,60 Dollar. Der Vorgänger Sonnet 5 kam in derselben Auswertung günstiger davon. Bei maximaler Anstrengung wurde das vermeintliche Sparmodell plötzlich zur teureren Maschine. Recherchequelle: artificialanalysis.ai
Anthropics Darstellung widersprechen diese Zahlen nicht zwangsläufig. Sie zeigen das Modell lediglich in einem anderen Betriebszustand. Ein Automotor kann auf der Landstraße sparsam und bei Vollgas durstig sein; beides beschreibt denselben Motor. Ähnlich verhält es sich mit Modellen, deren Rechenaufwand der Nutzer einstellen kann. „Bis zu 30 Prozent günstiger“ ist keine allgemeingültige Eigenschaft, sondern ein Ergebnis unter bestimmten Bedingungen.
Allerdings prüfte Artificial Analysis eine Vorabversion, in der ein inzwischen behobener Fehler strukturierte Ausgaben beeinträchtigen konnte. Der Anbieter des Benchmarks wollte die betroffenen Messungen deshalb wiederholen. Aufschlussreich bleibt die Größenordnung des Tokenverbrauchs dennoch. Sie zeigt, wie weit Listenpreis und tatsächlicher Aufgabenpreis auseinanderdriften können.
Zwischen Spargang und Vollgas liegt der brauchbare Bereich
Wie drastisch sich die gewählte Leistungsstufe auf die Rechnung auswirkt, veranschaulicht ein kleiner Praxistest von ComputingForGeeks. Mehrere Modelle sollten dort unter anderem Konfigurationsdateien für eine Kubernetes-Umgebung erstellen. Auf mittlerer Stufe bewältigte Sonnet 5.5 die geprüften Aufgaben in 36 Sekunden; die Modellkosten lagen bei knapp sieben Cent. Mit der höchsten Einstellung brauchte es dagegen fast 15 Minuten und kostete rund 1,36 Dollar. Einen Vorteil brachte der zusätzliche Aufwand nicht: Beide Einstellungen lösten die geprüften Aufgaben vollständig.
Die niedrige Stufe war zwar ebenso günstig wie die mittlere, erzeugte jedoch Konfigurationen, die im realen System nicht funktionierten. Das Modell hatte eine entscheidende Schreibberechtigung übersehen. Der Test war überschaubar und erlaubt kein allgemeines Urteil über alle Aufgaben. Als Einzelfall ist er dennoch anschaulich: Zu wenig Rechenaufwand kann Fehler produzieren, zu viel bringt womöglich keinen zusätzlichen Nutzen. Der wirtschaftlichste Punkt liegt irgendwo dazwischen. Recherchequelle: computingforgeeks.com
Für Unternehmen ergibt sich daraus eine ungewohnte Aufgabe. Sie müssen nicht nur das passende Modell wählen, sondern auch festlegen, mit welcher Rechenintensität es arbeiten soll. Die höchste Einstellung mag zunächst als sichere Entscheidung erscheinen. Mehr Rechenaufwand müsste schließlich bessere Ergebnisse hervorbringen. Doch selbst Anthropics eigene Zahlen zeigen, dass diese Rechnung nicht immer aufgeht: Beim Programmierbenchmark FrontierCode erzielte Sonnet 5.5 auf der zweithöchsten Stufe ein besseres Ergebnis als auf „max“. Rechnet ein Modell länger, kann es sich in zusätzlichen Prüfungen, Werkzeugaufrufen oder unnötigen Änderungen verlieren.
Rechenfleiß ist nicht dasselbe wie Urteilskraft.
In der Praxis verschiebt sich das Bild erneut
Wie stark das Ergebnis von der jeweiligen Aufgabe abhängt, zeigt ein Test von CodeRabbit, einem Anbieter automatisierter Programmprüfungen. Das Unternehmen untersuchte Sonnet 5.5 zunächst anhand von 13 besonders schwierigen, bereits bekannten Fehlerfällen. Das neue Modell fand sechs davon, Sonnet 5 lediglich vier. Die verwertbaren Hinweise blieben nahezu gleich präzise.
Anschließend prüfte CodeRabbit 44 echte Änderungsvorschläge aus Open-Source-Projekten. Sonnet 5.5 brauchte dafür im Mittel sechs Minuten und 33 Sekunden pro Fall, der Vorgänger 13 Minuten und 31 Sekunden. Auch die reinen Modellkosten fielen deutlich niedriger aus: ungefähr 46 bis 47 Cent pro Prüfung statt 1,16 Dollar. In dieser konkreten Arbeitsumgebung war Sonnet 5.5 somit nicht 30, sondern rund 60 Prozent günstiger und etwa doppelt so schnell. Recherchequelle: coderabbit.ai
Verallgemeinern lässt sich dieser Befund nicht ohne Weiteres. CodeRabbit betrachtet einen speziellen Arbeitsablauf und hat ein eigenes Interesse an leistungsfähigen Prüfmodellen. Dennoch misst der Test etwas, das im Alltag zählt: nicht abstrakte Intelligenz, sondern gefundene Programmfehler, benötigte Zeit und tatsächlichen Verbrauch.
Wie stark das Resultat vom Prüfverfahren abhängt, bestätigt auch der unabhängige Vals Index. Sonnet 5.5 erreichte dort 69,22 Prozent und lag damit nur 0,47 Punkte hinter Opus 5.5. Eine komplette Testausführung kostete 20,80 Dollar, während Opus 5.5 auf 32,77 Dollar kam. In diesem Szenario lieferte Sonnet also beinahe dieselbe Leistung für weniger als zwei Drittel der Kosten. Recherchequelle: vals.ai
Ein günstiges Modell kann teuer werden
Die Kosten einer KI-Aufgabe beschränken sich nicht auf die API-Rechnung. Ein unbrauchbares Ergebnis zieht Wiederholungen, Kontrollen oder Korrekturen durch einen Mitarbeiter nach sich. Übersehene Fehler können später Schäden verursachen. Langsame Antworten blockieren unter Umständen automatisierte Prozesse, während unnötige Werkzeugaufrufe weitere Dienste belasten.
Beim KI-Einsatz ist daher eine nüchternere Buchhaltung nötig. Unternehmen sollten erfassen, wie viele Aufgaben beim ersten Versuch gelingen, wie oft menschliche Nacharbeit anfällt und wie viel Zeit bis zum überprüften Ergebnis vergeht. Auch Wiederholungen, Abbrüche, Werkzeugaufrufe und zwischengespeicherte Eingaben gehören in die Rechnung. Erst anhand dieser Werte lässt sich beurteilen, ob ein günstiges Modell tatsächlich zu einem wirtschaftlichen System führt.
Claude Sonnet 5.5 ist deshalb nicht wegen eines einzelnen Spitzenwerts interessant. Wichtiger ist, dass das Modell die Grenzen herkömmlicher Preislisten sichtbar macht. Zwei Dollar pro Million Eingabetoken sind eine exakte Zahl – und verraten dennoch wenig darüber, was eine fertige Präsentation, eine geprüfte Programmänderung oder eine bereinigte Tabelle am Ende kostet.
Der Tokenpreis verschwindet nicht. Doch er ist nicht länger das abschließende Urteil, sondern nur noch ein Einzelposten. Aussagekräftiger ist eine andere Einheit: die tatsächlich erledigte Aufgabe.
Weiterführende Informationen
Quellenhinweis: Einzelne Fakten, Einschätzungen und Prognosen dieses Beitrags stützen sich auf Veröffentlichungen der nachfolgend genannten Unternehmen und Institutionen. Die Links dienen zugleich der weiterführenden Information.
THE DECODER – Anthropic stellt Claude Sonnet 5.5 vor: Schneller und günstiger als der Vorgänger
Der Fachbeitrag erläutert Anthropics Effizienzversprechen, die unveränderten Tokenpreise und die erheblich niedrigeren Aufgabenkosten bei niedriger oder mittlerer Leistungsstufe.
https://the-decoder.de/anthropic-stellt-claude-sonnet-5-5-vor-schneller-und-guenstiger-als-der-vorgaenger/
NeoTeo – Anthropic startet Claude Sonnet 5.5 mit Leistungs- und Kostendaten
Die Auswertung ordnet die Messung von rund 193.000 Ausgabetoken und 7,60 US-Dollar pro Aufgabe bei maximalem Rechenaufwand samt Einschränkungen der Vorabversion ein.
https://www.neoteo.com/de/anthropic-startet-claude-sonnet-55-mit-leistungs-und-kostendaten
Unite.AI – Anthropic veröffentlicht Claude Sonnet 5.5 zu unverändertem Sonnet-5-Preis
Der Artikel vertieft CodeRabbits Praxiserfahrung mit besserem Urteilsvermögen, deutlich weniger Ausgabetoken und der geplanten Umstellung einfacher und mittlerer Codeprüfungen.
https://www.unite.ai/de/anthropic-releases-claude-sonnet-5-5-at-unchanged-sonnet-5-pricing/



