Notizen aus der Werkstatt

Sprachdaten synthetisch erzeugen: Akzente und Störlärm

Spracherkennung scheitert selten an klarer Hochsprache. Sie scheitert in der Küche, wenn die Dunstabzugshaube läuft, auf dem Bahnsteig bei einer Durchsage mit Hall, oder wenn jemand bayerisch Genuscheltes mit vollem Mund sagt. Solche Aufnahmen bekommt man nicht von Freiwilligen, und echte Sprecher in großer Zahl zu buchen ist teuer und langsam. Wir bauen stattdessen Stimmprofile. Ein Profil hat definiertes Alter, Geschlecht, Region und Sprechtempo. Wir rendern damit Sätze auf dem Modellserver, schicken die Aufnahme anschließend durch eine Raumimpulsantwort, je nach Zielkanal durch Telefon-Kompression oder Videokonferenz-Bandbegrenzung und legen Rauschen darüber. Für Kinderstimmen nutzen wir Modelle auf Basis erwachsener Sprecher mit Formantverschiebung, weil wir keine Aufnahmen von Minderjährigen machen wollen. Die Schwierigkeit liegt nicht im Rendern, sondern im Prüfen. Ein Korpus klingt schnell auffällig, wenn alle Sätze dieselbe Klangfarbe haben und zwischen Wörtern nie geatmet wird. Wir mischen deshalb absichtlich kleine Lautstärkeschwankungen ein, gelegentliches Räuspern und unregelmäßige Pausen. Ein Linguist hört Stichproben von fünf Prozent und korrigiert Zeitmarken, bevor geliefert wird. Die gefundene Fehlerquote steht im Übergabeprotokoll. Rechtlich ist der Aufwand im Vorfeld größer als bei Bildern, weil Sprache immer auf eine konkrete Person zurückgeht. Jedes Profil hat eine dokumentierte Einwilligung des zugrunde liegenden Sprechers. Vor dem Export entfernen wir Merkmale, mit denen sich die Person rückführen ließe, etwa charakteristische Betonungen. Bei Daueraufträgen halten wir Profil und Generator zwölf Monate vor, damit die Klangfarbe zwischen Lieferungen gleich bleibt.
Jonas Wehrhahn

Synthetische Daten sind kein Ersatz für echte Aufnahmen. Sie füllen die Lücken, die sich echt nicht schließen lassen, und sparen genau dort am meisten Zeit.

Jonas Wehrhahn — Inhaber, Coresynthetics
Weiterlesen

Der Blog von Coresynthetics

Alle Beiträge drehen sich um Trainingsdaten, Rendering und Sprachaufnahmen. Kein Marketing, sondern Ergebnisse aus laufenden Aufträgen.

Zum Blog