Jonas Wehrhahn
Kommt aus der Vermessung und hat die ersten Jahre jede Szene selbst kontrolliert. Entscheidet, welche Aufträge angenommen werden und welche nicht.
Coresynthetics ist ein Hamburger Dienstleister für synthetische Bild-, Sprach- und Textdaten. Wir produzieren Trainingsmaterial für Teams, deren Modelle an Fällen scheitern, die sich mit echten Aufnahmen kaum belegen lassen: Nebel auf Rotorblättern, Rost an Schweißnähten, Genuscheltes in einer lauten Küche. Seit 2015 bauen wir dafür Szenen in 3D, Stimmprofile auf dem Modellserver und Korpora mit Zeitmarken pro Wort.
Keine Marketingprosa. Diese Werte stammen aus internen Protokollen der letzten zwölf Monate und lassen sich für einzelne Aufträge belegen.
Wir haben 2015 mit drei Rechnern in einem Hinterhof angefangen. Die ersten Aufträge waren zwei Schweißnaht-Szenen für einen Hersteller von Kesselanlagen. Aus dieser Zeit stammt die Gewohnheit, vor jedem großen Batch eine kleine Stichprobe abzunehmen und dem Kunden zu zeigen.
Alle Assets im Haus wurden entweder selbst gebaut oder mit kommerzieller Lizenz erworben.
Zwei Modellierer, zwei Toningenieure, ein Maschinenlerner, ein Vertriebsleiter. Mehr Leute braucht ein Auftrag nicht, weil wir jeden Batch als Dienstleistung und nicht als Produkt behandeln.
Wenn ein synthetischer Datensatz für einen Fall nicht passt, sagen wir das im Erstgespräch. Bisher haben wir zwölf Anfragen abgelehnt, weil ein ehrlicher Drehtag billiger gewesen wäre.
Synthetische Daten sind eine Ergänzung. Sie füllen die Lücken, die sich echt nicht schließen lassen, und sparen dort am meisten Zeit, wo das Warten auf den passenden Moment teurer wäre als das Rendern.
Deshalb mischen wir bei fast jedem Auftrag ein paar echte Aufnahmen unter. Fünf bis fünfzehn Prozent reichen meistens, um dem Modell etwas mitzugeben, das ein reiner Render-Batch nicht liefern kann. Diese Empfehlung macht unsere Aufträge kleiner, und wir sagen sie trotzdem. Wer Modelle baut, kennt den Unterschied zwischen einem guten Recall im Trainingsbericht und einem, der auf dem Hof hält.
Die Mischung aus Visual Effects, Vermessung und maschinellem Lernen ist der Grund, warum unsere Datensätze brauchbar sind. Jeder Blickwinkel fehlt ohne den anderen.
Kommt aus der Vermessung und hat die ersten Jahre jede Szene selbst kontrolliert. Entscheidet, welche Aufträge angenommen werden und welche nicht.
Baut Umgebungen, Kameras und Lichtsituationen und hält die Asset-Bibliothek in Ordnung. Prüft jede Testrender-Serie gegen die Auftragszeichnungen.
Schaut sich Zwischenergebnisse aus dem Training der Kunden an und sagt früh, welche Klassen sich nie trennen lassen. Prüft auch die Labelqualität.
Entwickelt Stimmprofile, schreibt Sprechskripte und hört die Stichproben vor jedem Export. Zweite Linguistin im Team teilt sich dieselbe Aufgabe.
Betreibt Aufnahmekabine und Modellserver. Zuständig für Impulsantworten, Übertragungskanäle und alle Files im WAV-Ordner der Kunden.
Hält den Kontakt zu Kunden, schreibt Übergabeprotokolle und sorgt dafür, dass Nutzungsrechte und Lizenzen dokumentiert sind. Antwortet meistens innerhalb eines Werktags.
Diese Regeln gelten bei jedem Auftrag, egal ob es um einen Pilotdatensatz mit 5.000 Szenen oder um 600 Sprechstunden im Monat geht.
Nach etwa 800 Bildern stoppen wir und zeigen die Auswahl. Erst wenn Sie zustimmen, läuft der große Lauf an. Das kostet uns einen Tag und erspart Ihnen einen Fehlschlag von zwei Wochen.
Kein Asset wird zugeliefert, ohne dass die Lizenz dokumentiert ist. Zu jedem Datensatz gibt es eine Asset-Liste mit Herkunft und Lizenz, prüfbar für Ihre Rechtsabteilung.
Bei Sprachdaten reicht die Synthese nicht. Fünf Prozent jeder Lieferung wird von einem Linguisten durchgehört, Zeitmarken werden korrigiert, Fehlerquoten schriftlich gemeldet.
Jede Szene kommt mit festem Seed. Sie können denselben Datensatz in vier Monaten exakt erneut rendern, falls Ihr Modell andere Größenordnungen braucht und die Labels unverändert bleiben sollen.
Wenn ein Fall nicht zu uns passt, sagen wir das im Erstgespräch. Im letzten Jahr haben wir zwölf Anfragen abgelehnt, weil ein echter Drehtag billiger gewesen wäre.
Wir fragen regelmäßig nach, was das Material im echten Betrieb gebracht hat. Diese Rückmeldung landet nicht in Broschüren, sondern in unserem Edge-Case-Katalog für künftige Aufträge.
Unser Assistent hat in lauten Küchen kaum etwas verstanden. Nach dem Training auf 900 synthetischen Stunden mit Kochgeräuschen lag die Erkennungsrate dort bei 88 Prozent. Wichtiger als die Zahl: Coresynthetics hat uns erklärt, warum das Material so gebaut wurde.
Die Beiträge im Blog entstehen aus laufenden Aufträgen und enthalten keine Werbung. Längere Texte, konkrete Zahlen und Fehler, die wir selbst gemacht haben.
Zum Blog
Synthetische Bilddaten lösen nicht automatisch das Problem fehlender Trainingsbeispiele. Woran es liegt, wenn tausend Renderings nichts bringen, und wie viel echte Aufnahmen dazugehören.
Beitrag lesen
Warum Spracherkennung selten an Hochsprache scheitert und wie Stimmprofile, Raumimpulsantworten und Störlärm aus der Küche einen Korpus brauchbar machen.
Beitrag lesenWer keine Lust auf ein langes Erstgespräch hat, kann sich auf der Preisseite die Pakete in Ruhe ansehen. Alle Konditionen stehen dort.
Prozedurale Szenen mit kontrollierter Beleuchtung, Wetterlage und Kameraposition. Bounding-Boxen, Segmentierungsmasken und Tiefenkarten inklusive.
Stimmprofile mit definiertem Akzent, Alter und Kanaleigenschaften. Transkripte mit Wortzeitstempeln, geprüft von einem Linguisten vor der Lieferung.
Schicken Sie drei Beispielbilder oder 20 Sekunden einer schwierigen Aufnahme. Sie bekommen eine schriftliche Einschätzung und, wenn es passt, ein Angebot mit Skizze, wie viele Szenen oder Sprechstunden wir ansetzen würden.
Rechtliche Grundlagen für Aufträge stehen in den Allgemeinen Geschäftsbedingungen. Wie wir mit personenbezogenen Daten umgehen, steht in der Datenschutzerklärung.