Synthetische Sprachdaten für ASR und TTS
Coresynthetics nimmt synthetische Sprachkorpora auf, mit denen Ihr Team Spracherkennung und Sprachsynthese trainiert, ohne Sprecher durch halb Europa zu buchen. Wir erzeugen Stimmen mit definiertem Alter, Akzent und Sprechtempo, schicken sie durch realistische Raumimpulsantworten und liefern die Transkripte mit Wortzeitstempeln dazu.
Stimmen aus dem Synthesizer
Spracherkennung scheitert selten an klarer Hochsprache, sondern an Genuschel, Hintergrundmusik, schlechten Mikrofonen und Dialekten. Coresynthetics erzeugt genau diese unangenehmen Fälle gezielt: Stimmmodelle werden gerendert, durch Raumakustik, Codecs und Störgeräusche geschickt und anschließend von einem Linguisten geprüft.
Die Ausgabe erfolgt als 16-kHz- oder 48-kHz-WAV, auf Wunsch als Opus oder FLAC. Transkripte liefern wir im TextGrid-, EAF- oder JSON-Format mit Zeitmarken pro Wort, damit Ihr Trainer sie direkt einlesen kann.
Akzentprofil nach Wunsch
Sie wählen Region, Altersgruppe und Sprechgeschwindigkeit, wir mischen daraus ein Profil. Für Telefoniekanäle verschieben wir den Schwerpunkt auf ältere Stimmen mit tieferem Grundton.
Raum und Kanal
Küchen, Fahrkabinen, Großraumbüros und Bahnhofshallen stehen als Impulsantworten bereit. Jede Aufnahme läuft zusätzlich durch einen Übertragungskanal, den Sie auswählen.
Kinderstimmen ohne Kinder
Für Kinderstimmen nutzen wir Modelle auf Basis erwachsener Sprecher mit Formantverschiebung. So entstehen keine Aufnahmen von Minderjährigen.
Rechtliche Säuberung
Jedes Stimmprofil hat eine dokumentierte Einwilligung des zugrunde liegenden Sprechers. Vor dem Export entfernen wir Merkmale, mit denen eine Rückführung auf die Person möglich wäre.
Studio, Labor, Modellserver
Seit 2016 bauen wir Sprachkorpora. Ein Auftrag für einen Automobilzulieferer umfasste 6.000 Kommandosätze in sieben Akzenten für eine Freisprechanlage, ein anderer 18 Stunden Kindererzählung für einen Lernassistenten.
Das Team besteht aus Toningenieuren, zwei Linguisten und zwei Modellentwicklern. Wir arbeiten mit einer schallgedämpften Kabine in Hamburg und einem zweiten Rack in Frankfurt, das wir für das Batch-Rendering nutzen.
- Schallgedämpfte Kabine mit Doppelwand
- Linguistische Prüfung vor jedem Export
- Aufträge aus Automobil, Bildung und Telekommunikation
Unser Assistent hat in lauten Küchen kaum etwas verstanden. Nach dem Training auf 900 synthetischen Stunden mit Kochgeräuschen lag die Erkennungsrate dort bei 88 Prozent.
Sechs Stationen bis zum WAV
Der Weg folgt einem festen Muster. Bei mehrsprachigen Korpora laufen die Stationen parallel für jede Sprachvariante.
Stimmprofil definieren
Gemeinsam legen wir Geschlecht, Altersspanne, Region und Sprechtempo fest. Bei Dialekten nehmen wir drei Referenzaufnahmen aus dem Zielgebiet zur Abstimmung.
Sprechtexte schreiben
Unsere Linguisten erstellen Skripte mit Zahlen, Abkürzungen, Ortsnamen und Sätzen mit doppeldeutigen Wörtern. So entstehen Fälle, an denen Erkennung gern scheitert.
Rendern auf dem Modellserver
Die Synthese läuft auf vier V100-Karten. Ein Stimmprofil produziert rund 60 Stunden Material pro Tag, bei gleichbleibender Klangfarbe über die gesamte Länge.
Akustik und Kanal anwenden
Faltung mit den gewählten Impulsantworten, dann Kompression, Bandbegrenzung und Rauschen je nach Zielkanal. Telefon, Videokonferenz und Freisprechanlage klingen unterschiedlich.
Transkripte prüfen
Ein Linguist hört Stichproben von fünf Prozent und gleicht die Zeitmarken ab. Fehlerquote und gefundene Abweichungen stehen im Übergabeprotokoll.
Verpacken und übergeben
Wir schreiben WAV-Dateien, Transkripte und Stimmprofilbeschreibung in ein Verzeichnis nach Ihrer Ordnerlogik und übergeben per Transfer oder USB-Platte.
Was ein Korpus kostet
Alle Beträge sind Nettopreise ohne Umsatzsteuer. Sprechstunden richten sich nach der fertigen Zielaufnahme, nicht nach Rohmaterial.
Akzentpaket
- Ein Stimmprofil oder ein Dialekt
- Zwei Raumimpulsantworten
- Transkripte mit Wortzeitstempeln
- Lieferung nach 12 Werktagen
- Übergabeprotokoll mit Stichprobenprüfung
Mehrsprachiger Korpus
- Bis zu vier Sprachen oder Varietäten
- Acht Stimmprofile mit unterschiedlichem Geschlecht und Alter
- Sechs Impulsantworten und drei Übertragungskanäle
- Störgeräuschkulissen wie Kantine, Straße, Bahnsteig
- Zwei Korrekturrunden inklusive
Dauerproduktion
- Monatliche Lieferung mit gleichbleibender Klangfarbe
- Neue Stimmprofile innerhalb von zehn Werktagen
- Feste Ansprechperson im Studio
- Wiederkehrende Textbausteine auf Wunsch
- Archivzugriff auf ältere Aufnahmen
Aufnahmesituationen aus dem Archiv
Alle Beispiele stammen aus abgeschlossenen Aufträgen. Sprecheridentitäten sind unkenntlich gemacht.
Bevor Sie einen Korpus bestellen
Schicken Sie uns 20 Sekunden Ihrer schwierigsten Aufnahme
Coresynthetics hört sich Ihre problematische Datei an und sagt, ob synthetische Nachbarsamples helfen. Sie bekommen eine schriftliche Einschätzung und drei Testminuten mit passender Akustik.
Aufnahme prüfen lassenKorpus planen
Schreiben Sie uns, welche Sprachen, Übertragungskanäle und Störgeräusche in Ihrem Einsatzgebiet vorkommen. Daraus schätzen wir Sprechstunden und Renderzeit ab.
- Rückmeldung innerhalb eines Werktags
- Technische Vorklärung mit einem Toningenieur
- Drei Testminuten vor jeder Beauftragung
+49 40 8376 2941
coresynthetics@gmail.com
Studio Hamburg, Unnastraße 48, 20253