
Ein künstlicher Sprecher kann Wörter korrekt aussprechen und trotzdem am Sinn eines Satzes vorbeireden. ElevenLabs will mit dem neuen Sprachmodell Eleven v4 genau diese Lücke verkleinern: Es soll Pausen, Gefühl und den Wechsel zwischen mehreren Figuren besser aus dem Zusammenhang ableiten. Für Hörbücher, Videos und Sprachassistenten ist das interessanter als eine bloß glattere Computerstimme.
Das Wichtigste in Kürze
- ElevenLabs hat Eleven v4 und die schnellere Variante Eleven v4 Turbo vorgestellt. Beide sind laut Unternehmen in seinen Kreativ- und Agentenprodukten sowie per API verfügbar.
- Regieanweisungen im Text steuern etwa Flüstern, Lachen oder eine bestimmte Stimmung; die Stimmen sollen auch über längere Produktionen konsistenter bleiben.
- Turbo zielt auf Dialoge in Echtzeit. Die von ElevenLabs genannten 150 Millisekunden bis zum ersten hörbaren Ton sind eine Herstellermessung, kein unabhängiger Praxistest.
- Wer veröffentlichte Inhalte vertont, sollte Aussprache, Tonfall, Nutzungsrechte und die Zustimmung bei geklonten Stimmen weiterhin selbst prüfen.
Was an der Stimme neu ist
Bei Text-zu-Sprache-Systemen liegt die Schwierigkeit nicht nur darin, einen Satz fehlerfrei vorzulesen. Dieselben Wörter können als Warnung, Trost oder ironische Bemerkung gemeint sein. ElevenLabs beschreibt für Eleven v4 eine neue Architektur, die Tonfall, Tempo und den Kontext einer Szene stärker berücksichtigt. Eine Figur soll auf das zuvor Gesagte reagieren, statt wie eine unabhängig erzeugte Tonspur zu klingen. Das ist zunächst die Leistungsbeschreibung des Anbieters; ob sie für eine bestimmte Stimme und Sprache überzeugt, lässt sich nur mit einem eigenen Hörvergleich beurteilen.
Redakteure können die Vortragsweise direkt im Skript lenken. Kurze Anweisungen in eckigen Klammern stehen an der Stelle, an der sich die Stimme ändern soll. Die Dokumentation nennt beispielsweise Flüstern, Lachen und Seufzen; auch Geräusche sind möglich. Das kann bei einem Podcast mit mehreren Rollen die Nachbearbeitung vereinfachen. Es ist aber kein präziser Schnittbefehl: Ein Tag kann gelegentlich als Geräusch statt als Sprechanweisung verstanden werden. Wer einen verlässlichen Produktionsablauf braucht, sollte wichtige Passagen in mehreren Varianten anhören.
Für längere Texte verspricht ElevenLabs stabilere Stimmen über mehrere Abschnitte und neu erzeugte Zeilen hinweg. Das ist besonders für Hörbücher relevant: Ein hörbarer Wechsel der Stimmfarbe nach einem korrigierten Satz stört mehr als ein kleiner Fehler in einer kurzen Werbeaufnahme. Eleven v4 verarbeitet laut Modelldokumentation bis zu 10.000 Zeichen pro Anfrage. Ein ganzes Buch bleibt also ein Projekt aus vielen Abschnitten. Der Anbieter hebt hervor, dass das Verbinden solcher Abschnitte nun besser funktioniere; eine Garantie für durchgehend identischen Klang folgt daraus nicht.
Turbo soll Gespräche flüssiger machen
Die zweite Variante, Eleven v4 Turbo, richtet sich an Sprachagenten und andere Anwendungen, in denen ein Mensch auf eine gesprochene Antwort wartet. ElevenLabs beziffert die mittlere Zeit bis zum ersten hörbaren Ton in einem eigenen Vergleich auf rund 150 Millisekunden. An anderer Stelle nennt die Firma etwa 100 Millisekunden reine Inferenzlatenz. Das sind unterschiedliche Messgrößen, die man nicht zu einem einzigen Geschwindigkeitswert vermischen sollte. Eine komplette Antwort braucht weiterhin Zeit für Spracherkennung, das Sprachmodell, die Verbindung und die Audioausgabe.
Für Nutzer zählt deshalb weniger eine einzelne Millisekundenzahl als der Gesprächsfluss. Kann man unterbrechen? Beginnt die Stimme schnell genug, ohne falsche Betonung? Bleibt sie bei Rückfragen verständlich? ElevenLabs verbindet Turbo mit seiner Plattform ElevenAgents. Entwickler mit anderen Bausteinen müssen zusätzlich die Laufzeit ihrer gesamten Kette messen. Die schnellere Variante ist damit keine pauschal bessere Wahl: Bei einem eingesprochenen Erklärvideo zählt womöglich der Klang stärker als der Beginn der Wiedergabe.
So lässt sich v4 sinnvoll ausprobieren
Wer bereits ElevenLabs verwendet, kann zunächst denselben kurzen Text mit einer vertrauten Stimme in v4 und einem bisherigen Modell erzeugen. Am aussagekräftigsten sind schwierige Stellen: ein Name mit ungewohnter Aussprache, ein ruhiger Satz nach einem emotionalen Dialog und eine nachträglich korrigierte Zeile. Erst danach lohnt ein längerer Versuch mit mehreren Abschnitten. Die Stimme selbst beeinflusst das Ergebnis erheblich; ein Modellwechsel allein macht aus jeder Vorlage noch keine glaubwürdige Erzählung.
Eleven v4 und Turbo unterstützen nach Anbieterangaben mehr als 90 Sprachen. Bei einer geklonten Stimme soll die Sprecheridentität erhalten bleiben, während der Akzent zur Zielsprache passt. Das ist für mehrsprachige Erklärungen und Synchronisation nützlich, verlangt aber eine Prüfung durch Muttersprachler. Ein flüssig klingender Satz kann Namen falsch betonen oder eine Aussage emotional verschieben. Bei professionellen Stimmklonen kommen Einwilligung und vertraglich geklärte Nutzungsrechte hinzu. Das Modell verbessert ein Werkzeug; es ersetzt keine redaktionelle Abnahme.
Interessant ist auch der Vergleich mit offenen Sprachdaten. Der jüngst vorgestellte YODAS-v3-Datensatz für Sprach-Audio erleichtert Forschung an Erkennung und mehrsprachiger Verarbeitung. Eleven v4 ist dagegen ein fertiger kommerzieller Dienst für die Erzeugung gesprochener Ausgabe. Beide Entwicklungen berühren denselben Medienalltag, beantworten aber verschiedene Fragen: wie Systeme Sprache verstehen und wie überzeugend sie selbst sprechen.
Was von der Ankündigung bleibt
ElevenLabs liefert mit v4 konkrete neue Werkzeuge für Vortragsregie, längere Produktionen und schnelle Dialoge. Die unabhängige Speech Arena von Artificial Analysis bietet einen Vergleichsrahmen für Höreindrücke, doch ein allgemeiner Rang sagt wenig darüber, ob die eigene Stimme, Sprache und Textsorte funktioniert. Der sinnvollste nächste Schritt ist deshalb ein kontrollierter Vergleich mit identischem Skript. Wenn v4 dabei weniger Korrekturen und eine stimmigere Darbietung liefert, ist der Fortschritt im Arbeitsalltag greifbar. Wenn nicht, bleibt das bisherige Modell die vernünftige Wahl.

