
Sprachmodelle brauchen mehr als saubere Studioaufnahmen, wenn sie in lauten Räumen, mit verschiedenen Akzenten und in vielen Sprachen funktionieren sollen. Das Forschungsteam ESPnet hat am 27. September YODAS v3 veröffentlicht: einen offen zugänglichen Datensatz mit mehr als 1,1 Millionen Stunden Audio. Die neue Sammlung könnte vor allem Forschern helfen, Sprachverarbeitung außerhalb der großen, proprietären Datenbestände zu entwickeln.
Das Wichtigste in Kürze
- YODAS v3 enthält mehr als 1,1 Millionen Stunden Web-Audio und wird unter CC BY 3.0 bereitgestellt.
- Die Audiodateien liegen im 48-kHz-Format vor; bei mehr als 70 Prozent sind mindestens zwei tatsächlich unterschiedliche Kanäle vorhanden.
- Untertitel und englische Übersetzungen sind nur für einen Teil der Aufnahmen verfügbar und können Fehler enthalten.
- Der Datensatz ermöglicht Forschung an Spracherkennung, Übersetzung und Audiotechnik, ist aber noch kein fertiger Sprachassistent.
Was an der neuen Sammlung anders ist
Das Team hat öffentlich lizenzierte Videos gesammelt und deren Audiospur im ursprünglichen Opus-Format erhalten. Frühere große Sprachsammlungen wurden oft auf einen Kanal und geringere Abtastraten reduziert. Für die reine Erkennung gesprochener Wörter kann das genügen. Wer räumliche Klanginformationen, mehrere Sprecher oder Sprachsynthese untersuchen will, braucht jedoch häufig mehr von der ursprünglichen Aufnahme. YODAS v3 ist deshalb nicht einfach nur eine größere Textsammlung mit Tonspur.
Die Forscher geben an, dass mehr als 70 Prozent der Aufnahmen zwei voneinander unterscheidbare Kanäle besitzen. Das ist eine wichtige Präzisierung: Eine Datei mit zwei Kanälen enthält nicht automatisch echtes Stereo, denn beide Kanäle können identisch sein. Auch die Angabe 48 kHz garantiert keine entsprechende Klangqualität. Laut Datensatzkarte erreicht die gemessene effektive Abtastrate bei mehr als 92 Prozent der Aufnahmen mindestens 32 kHz; rund 67 Prozent erreichen 44,1 kHz. Solche Metadaten erlauben Forschern, Material passend zu ihrer Aufgabe zu filtern.
Viele Sprachen, aber keine perfekten Etiketten
Die wissenschaftliche Arbeit nennt 147 Sprachen. Diese Zahl beruht jedoch teilweise auf der vom Videoportal angegebenen Herkunftssprache. Die inzwischen ausführlichere Datensatzkarte organisiert die Dateien nach Sprachen der vorhandenen Untertitel und nennt dafür 102 Sprachcodes sowie einen Ordner für Aufnahmen ohne Untertitel. Beide Angaben beschreiben unterschiedliche Verfahren zur Zuordnung. Wer die Sprachabdeckung eines Trainingsprojekts bewertet, sollte deshalb nicht allein die Zahl 147 übernehmen, sondern die Metadaten und tatsächlich nutzbaren Stunden pro Sprache prüfen.
Etwa drei Viertel der Daten haben Transkripte. Für ungefähr 60 Prozent der nicht englischen Daten liegen englische Übersetzungen vor. Das eröffnet Versuche mit Untertiteln und Sprachübersetzung, bedeutet aber keine durchgehend von Menschen kontrollierten Texte. Die Arbeit beschreibt die Sammlung ausdrücklich als schwach annotiert: Viele Untertitel stammen aus automatischer Erkennung. Sprachkennungen gelten für ganze Dateien und können bei einzelnen Sätzen danebenliegen. Kleine Sprachen profitieren also möglicherweise vom Umfang, ohne dass die Etiketten automatisch zuverlässig werden. Diese Lücke ist auch bei unserem Blick auf KI für kleine Sprachen ein zentraler Punkt.
Auch die Auswahl der Aufnahmen verdient Aufmerksamkeit. Das Team suchte Videos mit sprachspezifischen Begriffen und bevorzugte neuere Uploads. Damit kann es mehr Material jenseits der größten Sprachen finden, bildet aber weder alle Sprecher noch alle Sprechsituationen gleichmäßig ab. Die Lizenzangabe auf der Datensatzseite ersetzt zudem nicht die Prüfung, ob ein konkretes Teilset für ein geplantes Projekt geeignet ist. Für ein Modell, das etwa Telefonate verstehen soll, zählt die Übereinstimmung der Trainingsaufnahmen mit echten Telefonaten mehr als die bloße Gesamtzahl der Stunden. Ein großer Datensatz ist ein Ausgangspunkt für Auswahl und Messung, nicht deren Ersatz.
Was die ersten Experimente zeigen
Die Autoren haben nicht behauptet, aus der gesamten Sammlung bereits einen marktreifen Sprachassistenten gebaut zu haben. Sie trainierten unter anderem Spracherkennungsmodelle auf ausgewählten Sprachmengen und verglichen verschiedene Filter für die Transkripte. In diesem begrenzten Versuch brachte weniger strenges Filtern bei den meisten untersuchten Sprachen bessere Fehlerraten. Das deutet darauf hin, dass der Umfang der Daten in diesem Versuchsaufbau nützlich war. Es beweist weder gleiche Qualität für alle Sprachen noch einen Vorsprung gegenüber kommerziellen Systemen.
Ein zweiter Versuch betraf Audiocodecs, also Verfahren, die Klang für Speicherung und Übertragung in kompakte Zeichenfolgen umwandeln. Ein mit hochauflösenden YODAS-Daten trainierter Codec schnitt in den berichteten Tests besser ab als die dort verglichenen Varianten mit niedrigerer Abtastrate. Der Vergleich umfasst ausgewählte Datensätze und Messwerte; hörbare Qualität in jeder realen Anwendung lässt sich daraus nicht ableiten. Gerade diese Trennung zwischen Forschungsresultat und Produktversprechen macht die Veröffentlichung interessant.
Ausblick: Offenheit hilft erst mit sorgfältiger Auswahl
Der Datensatz ist auf Hugging Face öffentlich verfügbar, die Plattform weist eine Größe von 55,4 Terabyte aus. Für Einzelpersonen ist das kein beiläufiger Download. Forschende können die Sammlung in Teilmengen nach Sprache, vorhandenen Untertiteln, effektiver Audiobandbreite und Kanalzahl untersuchen. Ob daraus bessere Sprachwerkzeuge für bislang unterversorgte Sprachen entstehen, hängt anschließend von überprüften Trainingsdaten, aussagekräftigen Tests und dem tatsächlichen Einsatzkontext ab. YODAS v3 liefert dafür Rohmaterial in einer bisher seltenen Größenordnung, kein fertiges Qualitätsurteil.

