Gemini 3.8 Flash: Googles Kampfpreis gegen Claude – und der Haken

Reihen von Server-Racks in einem Rechenzentrum mit blauer Beleuchtung
Photo by Marc PEZIN on Unsplash

Google hat am 2. September Gemini 3.8 Flash veröffentlicht, das dritte günstige Modell binnen sechs Wochen. Die Einstiegspreise unterbieten Anthropics Claude Opus 5 und OpenAIs GPT-5.6 Sol deutlich, und Google legt eine eigene Cybersecurity-Ausführung dazu. Der Wettbewerb bei KI-Modellen verlagert sich damit weiter weg von reiner Spitzenleistung und hin zum Preis pro Aufgabe. Wer die Zahlen genauer liest, erkennt allerdings, dass der niedrige Tokenpreis nicht automatisch eine niedrigere Rechnung bedeutet.

Das Wichtigste in Kürze

  • Gemini 3.8 Flash kostet in der Einführungsphase 0,75 US-Dollar je Million Eingabe-Token und 3,75 Dollar je Million Ausgabe-Token; ab 1. Januar 2027 verdoppeln sich beide Werte.
  • Zum Vergleich: Claude Opus 5 liegt bei 5 und 25 Dollar, GPT-5.6 Sol bei 4 und 20 Dollar je Million Token.
  • Trotz gleichem Tokenpreis wie beim Vorgänger stiegen die Kosten pro Aufgabe laut der Analysefirma Artificial Analysis um rund 40 Prozent, weil das Modell mehr Rechenschritte und Werkzeugaufrufe verbraucht.
  • Eine zweite Variante namens Gemini 3.8 Flash Cyber ist auf das Finden und Schließen von Software-Lücken trainiert und nur über ein Partnerprogramm zugänglich.
  • Googles eigentliche Spitzenmodelle Gemini 3.5 Pro und Gemini 4 sind weiter nicht erschienen.

Ein Modell, zwei Ausführungen

Die Standardversion von Gemini 3.8 Flash zielt auf Programmierung, KI-Agenten und mehrstufiges Schlussfolgern. Im Benchmark DeepSWE v1.1, der länger laufende Softwareaufgaben misst, erreicht das Modell 73,7 Prozent und liegt damit knapp hinter Claude Opus 5 mit 74,0 Prozent und vor GPT-5.6 Sol mit 72,7 Prozent. Der Vorgänger Gemini 3.7 Flash kam hier auf 65,3 Prozent. Beim Intelligence Index von Artificial Analysis, einem zusammengesetzten Wert aus mehreren Tests, steigt Gemini 3.8 Flash von 56 auf 59 Punkte. Die offizielle Modellkarte von Google DeepMind nennt ein Kontextfenster von einer Million Token bei der Eingabe und maximal 64.000 Token Ausgabe, einen Wissensstichtag im März 2026 sowie bekannte Schwächen: gelegentliche Halluzinationen und vereinzelte Zeitüberschreitungen bei hoher Auslastung.

Die zweite Ausführung, Gemini 3.8 Flash Cyber, ist auf Schwachstellenanalyse spezialisiert. Sie erreicht im CyberGym-Benchmark 86,2 Prozent und liegt damit vor GPT-5.5-Cyber mit 85,6 Prozent; beim automatischen Patchen im CWE-Bench schafft sie 47,2 Prozent und bleibt knapp hinter Anthropics Fable 5. Gegen Prompt-Injection, also versteckte Anweisungen in Eingabedaten, gibt Google eine Angriffserfolgsquote von 5,5 Prozent an. Wie schnell sich solche Agentensysteme verselbständigen können, hat zuletzt Anthropics Experiment mit einem bewusst manipulativen Modell gezeigt.

Der Preis, der keiner ist

Gemini 3.8 Flash kostet exakt so viel wie der Vorgänger 3.7 Flash: 0,75 Dollar je Million Eingabe-Token und 3,75 Dollar je Million Ausgabe-Token. Diese Einführungspreise gelten bis Ende 2026, danach steigen sie auf 1,50 und 7,50 Dollar. Selbst der höhere Wert liegt noch klar unter Claude Opus 5 und GPT-5.6 Sol. So weit die Schlagzeile. Artificial Analysis hat aber auch die tatsächlichen Kosten einer Standardaufgabe gemessen, und die stiegen von 0,40 Dollar beim 3.7 Flash auf 0,58 Dollar beim neuen Modell, ein Plus von rund 40 Prozent. Der Grund liegt in der Arbeitsweise: Gemini 3.8 Flash strengt sich mehr an, es legt zusätzliche Denkschritte ein und ruft Werkzeuge mehrfach auf. Jeder dieser Schritte verbraucht Token, und in der Summe frisst der Mehrverbrauch den niedrigeren Stückpreis teilweise wieder auf. Für Anwendungen, bei denen es auf jeden Cent ankommt, kann der Vorgänger die günstigere Wahl bleiben.

Flash Cyber und das Fairwind-Programm

Die Cyber-Variante gibt Google nicht frei an alle. Der Zugang läuft ausschließlich über das neu gestartete Fairwind-Programm, das sich an Behörden, Betreiber kritischer Infrastruktur und Pflegeteams großer Software-Projekte richtet. Nach Google-Angaben sind bereits mehr als 650 Partner beteiligt, darunter die Sicherheitsfirma CrowdStrike und der Datenplattform-Anbieter Snowflake. Innerhalb des Programms laufen die Sicherheitsfilter weniger streng, damit die Partner das Modell für defensive Aufgaben wie Penetrationstests nutzen können. Vergleichbare kontrollierte Kanäle betreiben auch Anthropic und OpenAI. Der Ansatz ist ein Eingeständnis: Ein Modell, das Lücken zuverlässig findet, kann sie auch ausnutzen, und deshalb entscheidet der Anbieter selbst, wer es in voller Schärfe bekommt.

Was das für Nutzer heißt

Google ordnet die Flash-Serie selbst als Preis-Leistungs-Angebot ein, während die eigentlichen Spitzenmodelle Gemini 3.5 Pro und Gemini 4 auf sich warten lassen. Der neue DeepMind-Chef Koray Kavukcuoglu betont zwar, das Unternehmen verfolge beide Ziele zugleich, doch vorerst liefert Google Tempo im günstigen Segment und kein neues Flaggschiff. Für Entwicklerinnen und Entwickler im deutschsprachigen Raum bedeutet das: leistungsfähige Modelle zu niedrigen Listenpreisen sind inzwischen reichlich vorhanden, aber die Rechnung hängt am tatsächlichen Tokenverbrauch, nicht am Preisschild. Wer Wert auf Datenkontrolle legt, sollte auch die offene Konkurrenz prüfen: über Ollama Cloud laufen aktuelle Open-Source-Modelle wie Qwen 3.5, DeepSeek V4, GLM-5.3 oder Kimi K3 als Alternative zu den großen Anbietern, teils zu vergleichbaren Kosten. Und wie schon bei den geleakten Benchmarks zu GPT-6 Astra gilt: Ein einzelner Testwert sagt wenig über den Alltag aus. Entscheidend ist, wie ein Modell die konkrete Aufgabe löst, wie oft es dabei nachhakt und was am Monatsende auf der Abrechnung steht.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen