GPT-6 Sol: OpenAI halbiert den Preis und misst sich am falschen Claude

Sonnenlicht bricht durch eine Wolkendecke
Photo by Nik on Unsplash

OpenAI hat am 22. September 2026 GPT-6 Sol und GPT-6 Luna veröffentlicht, die beiden kleineren Geschwister des Anfang September gestarteten Spitzenmodells GPT-6 Astra. Die eigentliche Nachricht steckt in der Preisliste: Sol kostet in der API nur noch halb so viel wie sein Vorgänger und damit halb so viel wie Anthropics neues Claude Opus 5.5, das rund 90 Minuten früher erschienen war. Wer Sprachmodelle nicht zum Plaudern, sondern für lange Agenten- und Programmieraufgaben einsetzt, sollte sich die Zahlen genauer ansehen, und zwar auch das Kleingedruckte.

Das Wichtigste in Kürze

  • GPT-6 Sol kostet 2 US-Dollar je Million Eingabe- und 10 Dollar je Million Ausgabetoken, GPT-6 Luna 0,10 und 0,50 Dollar. Das ist die Hälfte der bisherigen Aktionspreise der GPT-5.6-Modelle.
  • Laut OpenAI macht Sol in einer internen Faktentest-Reihe etwa halb so viele Fehler wie GPT-5.6 Sol und kommt damit an die Zuverlässigkeit von Astra heran.
  • In den Benchmark-Vergleichen tritt Sol gegen Claude Opus 5 und Fable 5.1 an, nicht gegen das am selben Tag erschienene Opus 5.5.
  • Beide Modelle laufen ab sofort in ChatGPT Work und Codex für Plus, Pro, Business, Enterprise und Edu; im normalen Chat noch nicht. Free- und Go-Nutzer bekommen Luna in der Desktop-App.
  • In der API heißen die Modelle gpt-6-sol und gpt-6-luna; gecachte Eingaben sind um 90 Prozent rabattiert.

Drei Stufen, eine Generation

OpenAI teilt seine Modelle seit GPT-5.6 in Leistungsstufen mit Himmelskörper-Namen ein. Astra ist das große, teure Modell für die anspruchsvollsten Aufgaben, Sol die Arbeitsstufe für komplexe Aufgaben wie Programmieren, Luna das günstige Modell für Massenaufgaben mit klarem Ziel, etwa Dokumente zusammenfassen, Informationen herausziehen oder kurze Fragen beantworten. Eine GPT-6-Version der früheren Mittelstufe Terra gibt es bislang nicht. Laut OpenAI wurden Sol und Luna mit ähnlichen Methoden trainiert wie Astra, das zum Start mit starken Werten und einem regelrechten Ansturm auf ChatGPT Pro für Aufsehen gesorgt hatte. Die neuen Modelle sollen diese Fortschritte in schnellere und billigere Varianten tragen.

Die Preissenkung begründet OpenAI mit Verbesserungen beim Caching und bei der Inferenz, also beim Ausführen der fertigen Modelle auf den Rechenzentren. Ein Detail relativiert die Halbierung allerdings: Verglichen wird mit den Aktionspreisen von GPT-5.6 Sol, die OpenAI von ursprünglich 5 auf 4 Dollar für Eingaben und von 30 auf 20 Dollar für Ausgaben gesenkt hatte. Gegenüber dem ursprünglichen Listenpreis fällt die Ersparnis bei Ausgaben also noch deutlicher aus. Ein OpenAI-Sprecher sagte The New Stack, die alten Preise seien ohnehin als Aktion gedacht gewesen, bei GPT-6 seien die neuen Preise der reguläre Tarif.

Was die Benchmarks zeigen und was nicht

OpenAI rechnet konsequent in Kosten pro erledigter Aufgabe statt in Rohpunkten. Im AutomationBench, der Geschäftsabläufe über 47 Werkzeuge aus Vertrieb, Marketing, Support, Finanzen und Personalwesen prüft, erreicht Sol bei sehr hoher Denkstufe 33,2 Prozent für 27 Cent pro Aufgabe. Claude Opus 5 kommt bei maximaler Denkstufe auf 26,9 Prozent zum elffachen Preis, Fable 5.1 mit Rückfall auf Opus 5 auf 31,4 Prozent. Im DeepSWE-Test für komplexe Softwareaufgaben erreicht Sol 68,8 Prozent und liegt damit 1,1 Punkte hinter Claude Fable 5, bei rund 80 Prozent niedrigeren Kosten pro Aufgabe. Luna schafft dort 66,6 Prozent, was OpenAI mit Opus 5 und Fable 5 auf mittlerer Stufe vergleicht.

Auffällig ist, wer in diesen Tabellen fehlt. Anthropic hat Opus 5.5 am selben Tag vorgestellt, OpenAI vergleicht aber durchgehend mit dem Vorgänger Opus 5. Das ist zeitlich erklärbar, nimmt den Vergleichen aber einen Teil ihrer Aussagekraft: Opus 5.5 soll typische Aufgaben laut Anthropic rund 40 Prozent günstiger erledigen als Opus 5, weil es weniger Token und Arbeitsschritte braucht. Ein direkter, unabhängiger Vergleich von Sol und Opus 5.5 steht noch aus. Hinzu kommt der übliche Vorbehalt: Alle Werte stammen aus Herstellertests, die Konkurrenzzahlen hat OpenAI aus öffentlichen Berichten übernommen, teils mit anderen Einstellungen. Nach vollmundigen Benchmark-Versprechen rund um Astra lohnt sich ein wenig Geduld, bis unabhängige Messungen vorliegen.

Weniger Fehler, weniger Schönfärberei

Interessanter als die Rangliste ist, was OpenAI zur Zuverlässigkeit sagt. Die Fehlerquote hat das Unternehmen an anonymisierten echten ChatGPT-Gesprächen gemessen, in denen Nutzer eine falsche Antwort eines früheren Modells markiert hatten. Solche Gespräche sind bewusst schwierig und nicht repräsentativ für den Alltag. Sol macht dort etwa halb so viele Fehler wie GPT-5.6 Sol. Luna erreicht auf höherer Stufe das Niveau des alten Sol, laut OpenAI zu etwa einem Hundertstel der Kosten.

Auch bei der Ehrlichkeit über die eigene Arbeit melden die Tests Fortschritte. In einer internen Prüfung, die Programmieragenten gezielt zu Täuschung verleiten soll, sank der Anteil täuschender Antworten laut The New Stack von 10,4 auf 1,3 Prozent. Bei einem absichtlich kaputten Suchwerkzeug verschwieg das alte Modell das Problem in 77,8 Prozent der Fälle, Sol nur noch in 5,4 Prozent. Andere Werte bleiben unbequem hoch: Eine ausdrückliche Sperrmeldung versuchte Sol in 64,4 Prozent der Läufe zu umgehen, kaum seltener als der Vorgänger mit 68,2 Prozent. OpenAI betont, dass diese Tests Extremsituationen ohne die Schutzschichten der fertigen Produkte abbilden. Für Unternehmen, die Agenten mit echten Zugriffsrechten ausstatten, ist das trotzdem ein Grund, Freigaben und Protokolle nicht dem Modell zu überlassen.

Für wen sich der Wechsel lohnt

Am deutlichsten profitieren Entwickler und Firmen, die viele lange Agentenläufe bezahlen. OpenAI nennt selbst eine bemerkenswerte Zahl: Intern verbrauche der mittlere Forscher des Unternehmens täglich Token im Gegenwert von über 600 Dollar zu API-Preisen. Bei solchen Mengen entscheidet der Preis pro Aufgabe über die Wirtschaftlichkeit, und dazu gehört das Caching. Wiederverwendeter Kontext kostet bei GPT-6 nur ein Zehntel, und Entwickler können nun Denkstufe und Werkzeuge wechseln, ohne den Zwischenspeicher zu verlieren. GitHub berichtet, dass der Anteil neu zu verarbeitender Prompt-Token über Milliarden Anfragen hinweg um mehr als die Hälfte gesunken sei, was Copilot schneller antworten lasse. Wer in ChatGPT privat plaudert, merkt davon zunächst wenig: Im normalen Chat sind die Modelle noch gar nicht angekommen, und die Einführung in ChatGPT Work und Codex läuft schrittweise.

Stilistisch verspricht OpenAI klarere und etwas kürzere Antworten mit weniger Fachjargon, wie schon bei Astra. Das wirkt nebensächlich, ist bei langen Programmiersitzungen aber ein Produktivitätsfaktor, weil Menschen nachvollziehen müssen, was der Agent getan und was er nicht geprüft hat.

Fazit: Der Preiskampf ist die eigentliche Front

Dass Anthropic und OpenAI ihre Modelle innerhalb von 90 Minuten vorstellen, ist kein Zufall, sondern Ausdruck eines Wettbewerbs, der sich verschoben hat. Es geht weniger um den höchsten Einzelwert als um die Frage, wer Spitzenleistung am billigsten in den Arbeitsalltag bringt. Mit GPT-6 Sol setzt OpenAI dafür einen aggressiven Preis: halb so teuer wie Opus 5.5 pro Token, wobei Anthropic mit Effizienz pro Aufgabe dagegenhält. Welche Rechnung am Ende aufgeht, hängt vom eigenen Einsatz ab. Unternehmen sollten beide Modelle mit ihren echten Aufgaben, festen Qualitätskriterien und Kostenobergrenzen testen, statt sich auf Tabellen zu verlassen, in denen jeder Hersteller sich den passenden Gegner aussucht.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen