Gemini 4 Argon: Googles Spitzenmodell glänzt, aber denkt teuer

Lange Reihen von Serverschränken mit leuchtenden Statuslampen in einem Rechenzentrum
Photo by Valentin Lacoste on Unsplash

Google meldet sich mit Gemini 4 Argon an der Spitze der KI-Modelle zurück: Das neue Modell liefert bis zu eine Million Token in einer einzigen Antwort, führt mehrere Ranglisten für Wissensarbeit an und kostet zum Start nur halb so viel wie Anthropics Claude Opus 5.5. Benutzen können es vorerst aber nur ausgewählte IT-Sicherheitsteams. Ein genauer Blick lohnt trotzdem, denn die Zahlen zeigen, wo Argon wirklich glänzt und wo die Konkurrenz vorn bleibt.

Das Wichtigste in Kürze

  • Gemini 4 Argon ist Googles erstes Spitzenmodell seit mehr als sieben Monaten; eine Version 3.5 hat Google übersprungen.
  • Zuerst erhalten IT-Sicherheitsteams im „Fairwind“-Programm Zugang, zahlende API-Kunden und Abonnenten von Google AI Ultra folgen ohne festen Termin.
  • Der Einführungspreis liegt bei 2 Dollar je Million Eingabe- und 10 Dollar je Million Ausgabe-Token, später gelten 4 und 20 Dollar.
  • Im unabhängigen Index von Artificial Analysis zieht Argon mit GPT-6 Astra gleich, bleibt aber hinter Claude Opus 5.5 und Sonnet 5.5.
  • Auffällig gut: eine niedrige Halluzinationsrate und hohe Robustheit gegen Prompt-Injection. Auffällig hoch: der Token-Verbrauch pro Aufgabe.

Was Argon neu kann

Die markanteste Neuerung ist die Ausgabelänge. Statt bisher 64.000 Token kann Argon bis zu eine Million Token am Stück erzeugen. Die Konkurrenzmodelle Claude Opus 5.5, Claude Fable 5.1 und GPT-6 Astra liegen laut einer Übersicht von MarkTechPost bei je 128.000 Token. Eine Million Token entsprechen grob mehreren Romanen; praktisch relevant ist das für große Code-Umbauten, lange Berichte oder komplette Übersetzungen in einem Durchgang. Damit solche Antworten nicht an Zeitlimits scheitern, führt Google laut The Decoder eine API-Funktion namens „Long Decode Continuation“ ein. Eingaben nimmt Argon als Text, Bild, Video und Sprache entgegen, ausgegeben wird Text.

Wie das in der Praxis aussieht, beschreibt Google an internen Einsätzen. Tausende Mitarbeiter nutzen das Modell bereits. Derzeit hilft es etwa dabei, mehr als 800.000 Zeilen C- und C++-Code im Kernel des Betriebssystems Fuchsia nach Rust zu übertragen, einer Programmiersprache, die ganze Klassen von Speicherfehlern ausschließt; das Ergebnis wird vor dem produktiven Einsatz noch automatisch und von Hand geprüft. Beim Videodecoder libgav1 ersetzte Argon 32.000 Zeilen SIMD-Code, also hochoptimierte Prozessorbefehle; das Ergebnis läuft nach Googles Angaben 2,7-mal schneller als die bisherige Rust-Portierung.

Der zweite Schwerpunkt ist Cybersicherheit. Argon soll kritische Schwachstellen in Software selbstständig finden, bestätigen und beheben. Deshalb geht das Modell zuerst an geprüfte Verteidiger im Fairwind-Programm, und zwar ausdrücklich in einer Version ohne die üblichen Cyber-Schutzschranken. Der Cloud-Sicherheitsanbieter Wiz hat damit nach Googles Darstellung bereits eine kritische Lücke in weltweit genutzter Krankenhaus-Software gefunden, über die sensible persönliche Daten offenlagen. Parallel nimmt Google am freiwilligen Verfahren der US-Regierung teil, das Behörden vor der Veröffentlichung Zugang zu neuen Modellen gibt.

Die Benchmarks: stark in Wissensarbeit, nicht überall vorn

Googles eigene Vergleichstabellen fallen deutlich aus. Laut einer Auswertung von VentureBeat führt Argon in 12 von 18 veröffentlichten Tests allein und teilt sich in einem weiteren den ersten Platz. Beim Programmier-Benchmark DeepSWE v1.1 erreicht es 77,9 Prozent, gegenüber 74,1 Prozent für GPT-6 Astra und 74,2 Prozent für Opus 5.5. Am größten ist der Abstand bei juristischer Agentenarbeit: Im Legal-Agent-Benchmark der Kanzleisoftware Harvey kommt Argon auf 19,6 Prozent, Astra auf 5,4 und Opus 5.5 auf 3,8 Prozent. Auch bei Finanzaufgaben (Vals Finance Agent v2: 65,4 gegenüber 53,5 und 58,6 Prozent) liegt Argon klar vorn.

Die Tabellen zeigen aber auch die Lücken. Im Terminal-Bench 4.0, der das Arbeiten in der Kommandozeile prüft, liegt Opus 5.5 mit 66,4 Prozent deutlich vor Argon mit 57,4 Prozent. Bei FrontierSWE v2, einem anspruchsvollen Software-Test, führt GPT-6 Astra mit 65,5 zu 55,0 Prozent. Wer Argon vor allem als Programmierassistenten im Terminal einsetzen will, sollte also nicht allein auf die Gesamtbilanz schauen.

Unabhängige Messungen bestätigen dieses gemischte Bild. Im Intelligence Index von Artificial Analysis erreicht Argon in der Rechenstufe „High“ 53 Punkte und liegt damit gleichauf mit GPT-6 Astra und Claude Fable 5.1. Claude Opus 5.5 führt mit 58 Punkten, Sonnet 5.5 folgt mit 56. Gegenüber der Vorabversion von Gemini 3.1 Pro ist das ein Sprung um 23 Punkte. Im Vals Index von Vals AI steht Argon mit 68,9 Prozent dagegen erstmals für ein Gemini-Modell auf Platz eins.

Der Haken liegt im Token-Verbrauch

Auf dem Papier ist Argon günstig. Der Einführungspreis entspricht einem Fünftel von GPT-6 Astra (10 und 50 Dollar je Million Token) und der Hälfte von Opus 5.5 (4 und 20 Dollar); zwischengespeicherte Eingaben kosten 95 Prozent weniger. Wie lange der Rabatt gilt, sagt Google nicht. Danach liegt Argon auf dem Preisniveau von Opus 5.5. Google setzt also zunächst auf einen aggressiven Einstieg, ähnlich wie beim kürzlich vorgestellten Gemini 3.8 Live, mit dem Google OpenAI im Preis unterbot.

Entscheidend ist allerdings, was eine erledigte Aufgabe kostet. Argon denkt ausführlich: Artificial Analysis misst im Schnitt 62.000 Ausgabe-Token pro Aufgabe, GPT-6 Astra kommt mit 27.000 aus. Zum Einführungspreis kostet eine Aufgabe aus dem Index bei Argon deshalb 1,99 Dollar und damit 60 Prozent dessen, was Astra verlangt (3,26 Dollar). Nach Ende des Rabatts steigt der Wert auf 3,98 Dollar und läge rund 20 Prozent über Astra. Das im September auf dem OpenAI DevDay vorgestellte GPT-6.1 Sol erledigt dieselben Aufgaben zum Einführungspreis immer noch 2,7-mal günstiger.

Zwei Messwerte sprechen dagegen klar für Argon. In Artificial Analysis‘ Wissenstest AA-Omniscience erfindet es nur in 15 Prozent der Fälle eine Antwort, wo es keine weiß; bei GPT-6 Astra sind es 51 Prozent. Und im Prompt-Injection-Test von Gray Swan, bei dem versteckte Anweisungen in Webseiten oder Dokumenten ein Modell kapern sollen, gelingen bei Argon nur 0,7 Prozent der Angriffe, bei Opus 5.5 1,0 und bei GPT-6 Astra 8,5 Prozent. Für Agenten, die selbstständig fremde Inhalte lesen, ist das eine wichtige Eigenschaft.

Ausblick: ein starkes Modell mit offenem Starttermin

Mit Argon ist Google nach einer längeren Durststrecke wieder ein ernsthafter Kandidat für anspruchsvolle Wissensarbeit, besonders dort, wo lange Ergebnisse, juristische und finanzielle Analysen oder verlässliche Fakten zählen. Für Teams, die heute ein Modell auswählen, ändert sich aber noch nichts: Es gibt weder einen Termin für die API noch Angaben zur Verfügbarkeit in Europa. Wer später wechseln will, sollte nicht den Listenpreis vergleichen, sondern die eigenen Aufgaben mit echten Token-Zählern durchrechnen. Erst dann zeigt sich, ob der günstige Einstiegspreis den hohen Denkaufwand ausgleicht.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen