Gemini 3.8 Live: Google unterbietet OpenAI deutlich im Preis

Sprachassistent-Gerät auf einem Schreibtisch als Sinnbild für KI-gestützte Sprachagenten
Photo by BENCE BOROS on Unsplash

Sprachassistenten, die während des Gesprächs im Hintergrund Aufgaben erledigen, ohne den Gesprächsfaden zu verlieren, waren bislang vor allem eine Ankündigung von OpenAI. Google DeepMind zieht jetzt mit zwei neuen Modellen nach – und positioniert sie explizit als schneller und deutlich günstiger als die Konkurrenz. Für Entwickler, die Sprach-Agenten bauen, ist das mehr als eine technische Randnotiz: Die Preisdifferenz zu OpenAIs Angebot ist so groß, dass sie über die Wirtschaftlichkeit ganzer Produkte entscheiden kann.

Das Wichtigste in Kürze

  • Google DeepMind veröffentlicht mit Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking zwei neue Audio-Modelle für Sprach-Agenten, die im Hintergrund Werkzeuge aufrufen, während sie weiterreden.
  • Gemini 3.8 Live Extended Thinking führt mit 82,6 Punkten das Speech-to-Speech-Leaderboard von Artificial Analysis an, knapp vor OpenAIs GPT-Live-1 Astra.
  • Google kostet eine Stunde Sprachkonversation im Standardmodell rund 0,84 US-Dollar – etwa ein Sechstel dessen, was OpenAIs vergleichbares Angebot verlangt.
  • Beide Modelle beherrschen über 97 Sprachen, verarbeiten visuelle Eingaben nahezu in Echtzeit und markieren erzeugte Audioausgaben mit dem Wasserzeichen SynthID.
  • Erste Partner wie Salesforce, ServiceNow und Lenskart setzen die Modelle bereits produktiv ein, verfügbar sind sie über die Gemini-API, Google AI Studio sowie schrittweise in Google-Produkten.

Zwei Modelle, ein gemeinsamer Kern

Gemini 3.8 Live richtet sich laut Google an Anwendungen, bei denen Kosten und Skalierbarkeit im Vordergrund stehen: „Built for scale and cost efficiency, combining conversational intelligence with fluid dialogue and visual grounding“, schreibt das Gemini-Audio-Team um Principal Engineer Tom Ouyang im offiziellen Blogbeitrag. Die zweite Variante, Gemini 3.8 Live Extended Thinking, ist für komplexere Aufgaben gedacht und verfügt über einen zusätzlichen Denkschritt, der mehrstufiges Schlussfolgern erlaubt – etwa bei verschachtelten Buchungsprozessen oder der Koordination mehrerer asynchroner Funktionsaufrufe. Anders als beim reinen Vorgängermodell soll dieser Denkschritt nicht zu spürbaren Gesprächspausen führen: Das Modell kommentiert seine Zwischenschritte hörbar, etwa mit Formulierungen wie „Let me check that…“, während es im Hintergrund weiterarbeitet.

Was die Modelle im laufenden Gespräch können

Der zentrale Fortschritt liegt darin, dass beide Modelle während eines laufenden Gesprächs Werkzeuge und API-Aufrufe ausführen können, ohne die Konversation zu unterbrechen. Ein Nutzer kann also eine Anfrage stellen, während das System im Hintergrund eine Aufgabe abarbeitet, das Ergebnis bestätigt und normal weiterspricht. Hinzu kommt die Verarbeitung visueller Eingaben in nahezu Echtzeit: In Demonstrationen begleitet das Modell etwa das Onboarding neuer Mitarbeiter mit Blick auf das, was gerade auf dem Bildschirm zu sehen ist, oder verwandelt eine skizzierte Handzeichnung samt gesprochenem Feedback in eine funktionsfähige React-Komponente. Die Sprachfähigkeit deckt automatisch mehr als 97 Sprachen ab, inklusive Wechsel mitten im Gespräch. Zu konkreten Latenzwerten in Millisekunden oder der Kontextfenstergröße macht Google keine Angaben – anders als OpenAIs GPT-Live-1, das laut eigener Ankündigung auf echten Full-Duplex-Betrieb setzt und damit Nutzer und Modell gleichzeitig sprechen und unterbrechen lässt. Google beschreibt für Gemini 3.8 Live Extended Thinking lediglich, dass das Modell gleichzeitig „schlussfolgert und spricht“ und mit Unterbrechungen umgehen kann, ohne den Begriff Full-Duplex selbst zu verwenden.

Preis und Leistung im Vergleich

Bei den Benchmarks von Artificial Analysis liegt Gemini 3.8 Live Extended Thinking mit 82,6 Prozent auf dem Speech-to-Speech-Qualitätsindex knapp vor OpenAIs GPT-Live-1 Astra mit 81,5 Prozent und vor xAIs Grok Voice Think Fast 2.0 mit 81,3 Prozent. Bei agentischen Aufgaben, gemessen am τ-Voice-Benchmark, erreicht Google 68,6 Prozent gegenüber 67,9 Prozent bei OpenAI und 56,5 Prozent bei xAI; beim spezialisierten Bankwesen-Test τ-Voice-Banking von Sierra liegt Google mit 35,1 Prozent ebenfalls vorn. Der eigentliche Unterschied zeigt sich jedoch beim Preis: Eine Stunde Sprachkonversation kostet bei Gemini 3.8 Live im Standardmodus rund 0,84 US-Dollar, bei der Extended-Thinking-Variante etwa 3,50 US-Dollar. OpenAIs GPT-Live-1 Astra verlangt dagegen rund 5,83 US-Dollar pro Stunde, xAIs Grok Voice Think Fast 2.0 liegt bei 4,80 US-Dollar. Das Standardmodell von Google kostet damit ungefähr ein Sechstel dessen, was OpenAIs vergleichbares Angebot verlangt – bei nach eigenen Angaben höherer Benchmark-Qualität. Wie sich diese Zahlen in der Praxis mit realen Nutzern und variabler Gesprächslänge schlagen, bleibt abzuwarten; Artificial-Analysis-Werte bilden Labortests ab, keine Produktivlast.

Wer die Modelle schon einsetzt

Google nennt in seinem Blogbeitrag bereits eine Reihe von Partnern, die die neuen Modelle produktiv nutzen oder testen, darunter Salesforce, ServiceNow, die indische E-Commerce-Plattform Lenskart und den Gesundheitsdienstleister Lumeris. Mehrere dieser Kunden loben laut Google insbesondere die Latenz, die Gesprächsflüssigkeit und die Fähigkeit zum zuverlässigen Werkzeugaufruf – konkrete Zahlen dazu nennt Google allerdings nicht, die Aussagen bleiben qualitativ. Verfügbar sind die Modelle für Entwickler ab sofort über die Gemini-API und Google AI Studio, für Unternehmenskunden zunächst als Private Preview in der Plattform Gemini Enterprise. Endnutzer treffen auf die Standardvariante bereits in Googles Search Live, die Extended-Thinking-Version soll schrittweise auch in Gemini Live, in Workspace-Diensten wie Docs für zahlende Abonnenten sowie in Gmail und Keep ankommen. Wer selbst experimentieren möchte, findet Beispiel-Apps im offiziellen GitHub-Repository von Google.

Was das für Entwickler bedeutet

Für Teams, die bereits an Sprach-Agenten arbeiten – etwa im Kundenservice, bei der Terminbuchung oder in internen Support-Tools –, verschiebt der Preisunterschied die Kalkulation spürbar: Anwendungen, die bei OpenAIs Preisen wirtschaftlich fraglich waren, etwa Dauergespräche mit vielen Nutzern gleichzeitig, könnten mit Googles Tarifen plötzlich rentabel werden. Wie schon beim Vorstoß von OpenAIs GPT-Live-1, das vor allem klassische Warteschleifen ablösen sollte, zeigt sich: Der Wettbewerb um Sprach-Agenten wird zunehmend über Kosten pro Gesprächsminute entschieden, nicht mehr allein über Benchmark-Werte. Wer aber auf besonders natürliche, unterbrechbare Gespräche mit echtem Full-Duplex-Betrieb angewiesen ist, dürfte laut aktuellem Stand weiterhin eher bei OpenAI landen – und dafür bewusst den höheren Preis in Kauf nehmen.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert

Nach oben scrollen