Blog · Coresynthetics

Notizen aus der Werkstatt.

Im Blog von Coresynthetics schreiben die Leute aus der Werkstatt auf, was beim Bau synthetischer Bild- und Sprachdaten praktisch schiefgeht und was sich bewährt hat. Keine Marketingtexte, keine Werbesprache, sondern Beobachtungen aus laufenden Aufträgen: warum tausend Renderings nicht automatisch zu einem guten Modell führen, wie ein Klassenkatalog entsteht und wann echte Aufnahmen besser sind als alles, was wir erzeugen können. Die Beiträge erscheinen unregelmäßig, meistens dann, wenn ein Auftrag etwas Neues ans Licht gebracht hat.

Bilddaten Sprachkorpora Edge Cases Klassenkataloge Raumakustik Renderpipeline Labelprüfung Stimmprofile Bilddaten Sprachkorpora Edge Cases Klassenkataloge Raumakustik Renderpipeline Labelprüfung Stimmprofile
Alle Beiträge

Zwei Beiträge aus dem letzten halben Jahr.

Die Beiträge sind lang genug, um als Einführung zu taugen, und kurz genug, um sie in einer Mittagspause zu lesen. Wer direkt einsteigen will, findet unten auf der Seite die passenden Leistungen.

Synthetische Trainingsdaten: Was wirklich hilft
Bilddaten · 6 Minuten Lesezeit

Synthetische Trainingsdaten: Was wirklich hilft

Die meisten Teams, mit denen wir sprechen, haben nicht zu wenig Rechenleistung. Sie haben zu wenig Beispiele für den Fall, der ihnen Ärger macht. Dieser Beitrag erklärt, warum synthetische Daten nicht automatisch das Problem lösen, worauf es bei kontrollierter Variation ankommt und wie viele echte Aufnahmen ins Trainingsset gehören.

Beitrag lesen
Sprachdaten synthetisch erzeugen: Akzente und Störlärm
Audiodaten · 5 Minuten Lesezeit

Sprachdaten synthetisch erzeugen: Akzente und Störlärm

Spracherkennung scheitert selten an klarer Hochsprache, sondern in der Küche, auf dem Bahnsteig oder bei Genuscheltem. Wie wir Stimmprofile bauen, durch Raumimpulsantworten und Übertragungskanäle schicken und prüfen, bevor ein Korpus ausgeliefert wird, steht in diesem Beitrag.

Beitrag lesen
Themen

Worüber hier geschrieben wird.

Der Blog ist bewusst schmal gehalten. Vier Themen, die immer wieder auftauchen, weil Kunden bei jedem Erstgespräch ähnliche Fragen stellen.

T/01

Klassenkatalog und Edge Cases

Wie Objektklassen entstehen, warum halb verdeckte Schilder mehr Ärger machen als fehlende Beispiele und welche Fälle vor jedem großen Batch abgestimmt werden müssen. Praktische Erfahrung aus Inspektion, Bahn und Logistik.

T/02

Rendering

Was feste Seeds bringen und warum erneutes Rendern billiger ist als ein neuer Batch.

T/03

Sprachaufnahmen und Akustik

Raumimpulsantworten, Übertragungskanäle und Störgeräusche. Warum ein Stimmprofil allein keinen brauchbaren Korpus ergibt und wie die Prüfung abläuft.

T/04

Recht und Lizenzen

Zum Thema Herkunft von Assets, dokumentierte Einwilligungen bei Stimmprofilen und was in einer Asset-Liste stehen muss, damit sie vor der Rechtsabteilung hält.

Wer hier schreibt

Keine Redaktion, nur sechs Kollegen.

Die Beiträge entstehen nicht in einer Marketingabteilung, sondern zwischen Aufträgen. Jeder Autor schreibt über sein eigenes Feld und steht für Rückfragen zur Verfügung, wenn ein Leser mehr wissen will.

Deshalb dauert es manchmal Monate, bis ein neuer Beitrag erscheint. Es gibt keinen Redaktionsplan, sondern nur die eine Regel: nichts veröffentlichen, das noch nicht in einem echten Auftrag ausprobiert wurde.

  • Nadja Cieslik schreibt über Verträge, Lizenzen und Herkunft von Assets
  • Marta Fehrmann schreibt über Sprachaufnahmen und Linguistik
  • Aleksandr Petrov schreibt über Modelltraining und Klassenkataloge
Arbeitsplatz mit Notizen und Kaffeetasse in der Werkstatt
Redaktionsplatz, Standort Hamburg
Passend zum Blog

Die beiden Leistungen hinter den Beiträgen.

Alle Beiträge drehen sich um eine der beiden Leistungen. Wenn Sie wissen wollen, was eine Beauftragung umfasst, finden Sie auf den Detailseiten Umfang, Preise und Ablauf.

Synthetische Bilddaten für Computer Vision
Bilddaten

Synthetische Bilddaten für Computer Vision

Prozedurale Szenen mit kontrollierter Beleuchtung, Wetterlage und Kameraposition. Lieferung mit Bounding-Boxen, Segmentierungsmasken und Tiefenkarten für Ihr Trainingsset.

ab 4.900 € Details ansehen
Synthetische Sprachdaten für ASR und TTS
Audiodaten

Synthetische Sprachdaten für ASR und TTS

Stimmprofile mit definiertem Akzent, Alter und Sprechgeschwindigkeit, anschließend durch Raumakustik und Übertragungskanäle geschickt. Transkripte mit Wortzeitstempeln inklusive.

ab 3.400 € Details ansehen

Für Aufträge gelten die Allgemeinen Geschäftsbedingungen. Zur Speicherung Ihrer Anfragen siehe Datenschutzerklärung.

Fragen zum Blog

Was Leser häufig fragen.

Wenn eine Frage hier fehlt, schreiben Sie uns über die Kontaktseite. Wir beantworten sie zusammen mit dem Ersttermin.

Nächster Schritt

Wenn ein Beitrag Ihre Frage nicht beantwortet hat.

Schreiben Sie uns einfach Ihren Fall. Drei Beispielbilder oder 20 Sekunden Audio reichen für eine erste Einschätzung. Wenn synthetische Daten für Ihren Fall nicht passen, sagen wir das im Erstgespräch, statt ein Angebot zu basteln, das niemand braucht.

Details zur Verarbeitung Ihrer Anfrage stehen in der Datenschutzerklärung. Vertragsbedingungen finden Sie in den Allgemeinen Geschäftsbedingungen. Für die Speicherung Ihrer Cookie-Auswahl auf der Startseite gilt die Cookie-Richtlinie.