Spracherkennung · Audiodaten

Synthetische Sprachdaten für ASR und TTS

Coresynthetics nimmt synthetische Sprachkorpora auf, mit denen Ihr Team Spracherkennung und Sprachsynthese trainiert, ohne Sprecher durch halb Europa zu buchen. Wir erzeugen Stimmen mit definiertem Alter, Akzent und Sprechtempo, schicken sie durch realistische Raumimpulsantworten und liefern die Transkripte mit Wortzeitstempeln dazu.

Leistungsumfang

Stimmen aus dem Synthesizer

Spracherkennung scheitert selten an klarer Hochsprache, sondern an Genuschel, Hintergrundmusik, schlechten Mikrofonen und Dialekten. Coresynthetics erzeugt genau diese unangenehmen Fälle gezielt: Stimmmodelle werden gerendert, durch Raumakustik, Codecs und Störgeräusche geschickt und anschließend von einem Linguisten geprüft.

Die Ausgabe erfolgt als 16-kHz- oder 48-kHz-WAV, auf Wunsch als Opus oder FLAC. Transkripte liefern wir im TextGrid-, EAF- oder JSON-Format mit Zeitmarken pro Wort, damit Ihr Trainer sie direkt einlesen kann.

2.100
Sprechstunden pro Produktionsmonat
11,8 %
Wortfehlerrate eines Referenzmodells nach dem Training
340
Stimmprofile in der Datenbank
19
abgedeckte Sprachen und Varietäten
B/01

Akzentprofil nach Wunsch

Sie wählen Region, Altersgruppe und Sprechgeschwindigkeit, wir mischen daraus ein Profil. Für Telefoniekanäle verschieben wir den Schwerpunkt auf ältere Stimmen mit tieferem Grundton.

B/02

Raum und Kanal

Küchen, Fahrkabinen, Großraumbüros und Bahnhofshallen stehen als Impulsantworten bereit. Jede Aufnahme läuft zusätzlich durch einen Übertragungskanal, den Sie auswählen.

B/03

Kinderstimmen ohne Kinder

Für Kinderstimmen nutzen wir Modelle auf Basis erwachsener Sprecher mit Formantverschiebung. So entstehen keine Aufnahmen von Minderjährigen.

B/04

Rechtliche Säuberung

Jedes Stimmprofil hat eine dokumentierte Einwilligung des zugrunde liegenden Sprechers. Vor dem Export entfernen wir Merkmale, mit denen eine Rückführung auf die Person möglich wäre.

Werkstatt

Studio, Labor, Modellserver

Seit 2016 bauen wir Sprachkorpora. Ein Auftrag für einen Automobilzulieferer umfasste 6.000 Kommandosätze in sieben Akzenten für eine Freisprechanlage, ein anderer 18 Stunden Kindererzählung für einen Lernassistenten.

Das Team besteht aus Toningenieuren, zwei Linguisten und zwei Modellentwicklern. Wir arbeiten mit einer schallgedämpften Kabine in Hamburg und einem zweiten Rack in Frankfurt, das wir für das Batch-Rendering nutzen.

  • Schallgedämpfte Kabine mit Doppelwand
  • Linguistische Prüfung vor jedem Export
  • Aufträge aus Automobil, Bildung und Telekommunikation
Aufnahmekabine mit Mikrofon und Dämmwänden
Stimmaufnahme mit Kondensatormikrofon, Studio Hamburg
Ines Bregenzer

Unser Assistent hat in lauten Küchen kaum etwas verstanden. Nach dem Training auf 900 synthetischen Stunden mit Kochgeräuschen lag die Erkennungsrate dort bei 88 Prozent.

Ines Bregenzer — Produktleitung Sprachassistent, Haushaltsgerätehersteller
Herstellung

Sechs Stationen bis zum WAV

Der Weg folgt einem festen Muster. Bei mehrsprachigen Korpora laufen die Stationen parallel für jede Sprachvariante.

S1

Stimmprofil definieren

Gemeinsam legen wir Geschlecht, Altersspanne, Region und Sprechtempo fest. Bei Dialekten nehmen wir drei Referenzaufnahmen aus dem Zielgebiet zur Abstimmung.

S2

Sprechtexte schreiben

Unsere Linguisten erstellen Skripte mit Zahlen, Abkürzungen, Ortsnamen und Sätzen mit doppeldeutigen Wörtern. So entstehen Fälle, an denen Erkennung gern scheitert.

S3

Rendern auf dem Modellserver

Die Synthese läuft auf vier V100-Karten. Ein Stimmprofil produziert rund 60 Stunden Material pro Tag, bei gleichbleibender Klangfarbe über die gesamte Länge.

S4

Akustik und Kanal anwenden

Faltung mit den gewählten Impulsantworten, dann Kompression, Bandbegrenzung und Rauschen je nach Zielkanal. Telefon, Videokonferenz und Freisprechanlage klingen unterschiedlich.

S5

Transkripte prüfen

Ein Linguist hört Stichproben von fünf Prozent und gleicht die Zeitmarken ab. Fehlerquote und gefundene Abweichungen stehen im Übergabeprotokoll.

S6

Verpacken und übergeben

Wir schreiben WAV-Dateien, Transkripte und Stimmprofilbeschreibung in ein Verzeichnis nach Ihrer Ordnerlogik und übergeben per Transfer oder USB-Platte.

Pakete

Was ein Korpus kostet

Alle Beträge sind Nettopreise ohne Umsatzsteuer. Sprechstunden richten sich nach der fertigen Zielaufnahme, nicht nach Rohmaterial.

Akzent

Akzentpaket

3.400 €
einmalig, 20 Sprechstunden
  • Ein Stimmprofil oder ein Dialekt
  • Zwei Raumimpulsantworten
  • Transkripte mit Wortzeitstempeln
  • Lieferung nach 12 Werktagen
  • Übergabeprotokoll mit Stichprobenprüfung
Akzent buchen
Dauerlauf

Dauerproduktion

22.500 €
pro Monat, 600 Sprechstunden
  • Monatliche Lieferung mit gleichbleibender Klangfarbe
  • Neue Stimmprofile innerhalb von zehn Werktagen
  • Feste Ansprechperson im Studio
  • Wiederkehrende Textbausteine auf Wunsch
  • Archivzugriff auf ältere Aufnahmen
Dauerlauf starten
Häufige Fragen

Bevor Sie einen Korpus bestellen

Nächster Schritt

Schicken Sie uns 20 Sekunden Ihrer schwierigsten Aufnahme

Coresynthetics hört sich Ihre problematische Datei an und sagt, ob synthetische Nachbarsamples helfen. Sie bekommen eine schriftliche Einschätzung und drei Testminuten mit passender Akustik.

Aufnahme prüfen lassen
Erstgespräch

Korpus planen

Schreiben Sie uns, welche Sprachen, Übertragungskanäle und Störgeräusche in Ihrem Einsatzgebiet vorkommen. Daraus schätzen wir Sprechstunden und Renderzeit ab.

  • Rückmeldung innerhalb eines Werktags
  • Technische Vorklärung mit einem Toningenieur
  • Drei Testminuten vor jeder Beauftragung

+49 40 8376 2941

coresynthetics@gmail.com

Studio Hamburg, Unnastraße 48, 20253