
OpenAI hat am 10. September mit GPT-Live-1 ein Sprachmodell in die API gebracht, das eine bislang lästige Schwäche von Telefon-Bots angehen soll: das ständige Unterbrechen. Statt Zuhören, Antworten und Sprechen nacheinander abzuarbeiten, verarbeitet GPT-Live-1 ein- und ausgehende Sprache gleichzeitig in einem einzigen Modell – „Full-Duplex“ nennt OpenAI das, in Anlehnung an Telefonleitungen, die in beide Richtungen zugleich übertragen können. Erste Kunden wie das Bewertungsportal Yelp und die Sprachlern-App Speak berichten von messbar natürlicheren Gesprächen.
Das Wichtigste in Kürze
- GPT-Live-1 verarbeitet Sprache in einem einzigen Modell statt in der bisherigen Kette aus Spracherkennung, Sprachmodell und Sprachausgabe – dadurch kann es zuhören und gleichzeitig sprechen.
- Im OpenAI-eigenen Full-Duplex-Benchmark springt die Trefferquote von 45,4 auf 80,1 Prozent gegenüber dem Vorgänger GPT-Realtime-2.1, die Reaktionszeit sinkt von 1,41 auf 0,80 Sekunden.
- Die Sprachlern-App Speak meldet fast 80 Prozent weniger Unterbrechungen während der Denkpausen von Lernenden.
- Die API kostet 0,05 US-Dollar pro Minute für die reine Sprachebene; komplexere Aufgaben delegiert GPT-Live-1 an angebundene Modelle wie Astra oder Codex, die zusätzlich abgerechnet werden.
- Zielgruppe sind Telefon-Agenten, Support, Terminplanung und Nachhilfe – überall dort, wo natürliches Unterbrechen und schnelles Reagieren über die gefühlte Qualität eines Gesprächs entscheiden.
Was „Full-Duplex“ konkret ändert
Bisherige Sprachassistenten funktionieren nach einem Halbduplex-Prinzip: Sie hören zu, warten eine Pause ab, verarbeiten das Gesagte und antworten erst dann – ähnlich einem Walkie-Talkie. Das führt zu den bekannten Ärgernissen bei Telefon-Bots: abgeschnittene Sätze, unpassende Pausen, Antworten, die mit dem eigentlichen Nachsatz kollidieren. GPT-Live-1 verarbeitet Audiosignale in beide Richtungen fortlaufend und kann deshalb erkennen, ob ein Sprecher nur kurz nach Worten sucht oder tatsächlich fertig ist. In OpenAIs eigenen Tests zeigt sich das am deutlichsten beim sogenannten Turn-Taking: Die Zeit bis zur Reaktion sank von 1,41 auf 0,80 Sekunden, bei einem Banking-Testszenario stieg die inhaltliche Trefferquote von 12,4 auf 32 Prozent. Das Modell übernimmt dabei nur die Sprachebene – Hintergrundgeräuschunterdrückung, Gesprächskontext über längere Sitzungen und die Erkennung von Ziffern und Buchstaben inklusive.
Wer die Technik schon einsetzt
Yelp nutzt GPT-Live-1 für telefonische Reservierungen und Bestellungen. CTO Alex Levy beschreibt den Effekt so, dass Anrufer inzwischen „vollständigere, natürlichere Sätze“ sprechen – ein Indiz dafür, dass sich das Gespräch am anderen Ende spürbar anders anfühlt. Bei der Sprachlern-App Speak, die Nutzer beim lauten Üben absichtlich Denkpausen einräumen muss, sank die Zahl der Unterbrechungen laut Mitgründer Andrew Hsu um beinahe 80 Prozent gegenüber dem bisherigen, rundenbasierten System. Der Kundenservice-Anbieter Fin beschreibt den Wandel weg vom „Stopp-und-Start-Rhythmus“ hin zum natürlichen Fluss eines echten Telefonats. Diese drei Beispiele treffen den wunden Punkt bisheriger Voice-Bots recht genau: Nicht die inhaltliche Klugheit der Antwort entscheidet über den Eindruck, sondern das Timing.
Ein Baustein, kein Alleskönner
OpenAI positioniert GPT-Live-1 bewusst als reine Sprachschicht, nicht als eigenständigen Agenten. Für Terminplanung oder häufige Standardanfragen lässt es sich mit dem schlankeren Modell Luna kombinieren, für komplexere Kundenanliegen mit Astra, für Programmieraufgaben während eines Gesprächs sogar mit Codex – jede Anbindung wird separat abgerechnet, sodass die reinen 0,05 Dollar pro Minute nur einen Teil der tatsächlichen Betriebskosten abbilden. Das erinnert an die Architektur, die OpenAIs neue Agents-API erst vor wenigen Tagen für textbasierte Aufgaben geöffnet hat: Auch dort liefert OpenAI die Infrastruktur, Entwickler bauen die eigentliche Anwendung obendrauf. Für Unternehmen, die bereits mit Sprachbots experimentieren, dürfte vor allem die Kombinierbarkeit interessant sein – etwa mit den Anforderungen, die sich schon bei KI-gestützter Beratung im Handel gezeigt haben, wo Geschwindigkeit und Verlässlichkeit oft wichtiger sind als sprachliche Brillanz.
Was das für Nutzer heißt
Für Verbraucher wird der Unterschied zunächst unsichtbar bleiben, bis Unternehmen die Technik tatsächlich in ihre Support-Hotlines und Buchungssysteme einbauen – ein Prozess, der erfahrungsgemäß Monate dauert. Der Preis von fünf Cent pro Minute liegt deutlich über klassischer Text-KI und macht GPT-Live-1 vor allem für Anwendungsfälle interessant, in denen ein besseres Gespräch direkt Umsatz oder Kundenzufriedenheit bringt, etwa bei Reservierungen, Bankgeschäften oder Sprachtraining. Ob sich die in Benchmarks gemessenen Fortschritte im Alltag tatsächlich als weniger genervte Anrufer niederschlagen, werden die kommenden Monate zeigen – die bisherigen Kundenstimmen sind naturgemäß handverlesen und stammen von Unternehmen, die eng mit OpenAI zusammenarbeiten. Auffällig ist zudem, dass OpenAI die Preisstruktur bewusst modular hält: Wer nur die Sprachschicht braucht, zahlt wenig, wer volle Handlungsfähigkeit will, zahlt für jedes zusätzlich angebundene Modell erneut – ein Baukasten, der Entwicklern Flexibilität verschafft, die Gesamtkosten für Unternehmen aber schwerer vorhersehbar macht als eine einfache Pauschale pro Anruf.

