Ein führender Anbieter KI-gestützter visueller Synchronisation für Film industrialisiert die Dataset-Erhebung
Modelle für visuelle Synchronisation im Kino zu trainieren erfordert riesige, gut strukturierte Datasets mit Videos sprechender Gesichter. Tornado API lieferte ein akademisch referenziertes Korpus von fast hunderttausend Videos direkt in ihren S3-Bucket, abgeglichen, verifiziert, in MKV.
Wie es anfing
Sie fanden Tornado über eine Google-Suche, während sie nach einem Weg suchten, ihr Trainingskorpus aufzubauen, und wandten sich direkt an den Gründer.
Herausforderung
Modelle für visuelle Synchronisation lernen aus Videos sprechender Gesichter, und sie brauchen davon Forschungsmengen in hoher Qualität, strukturiert nach akademischen Referenzen wie SpeakerVid und TalkVid. Ein Korpus von rund 100.000 referenzierten Videos im eigenen Haus aufzubauen hätte Monate Engineering an einem Problem bedeutet, das weit außerhalb ihres Kerngeschäfts liegt.
Jede Woche für Scraper, Proxies und Retry-Logik war eine Woche, die nicht in die Modelle selbst floss.
Lösung
Tornado führte die Lieferung als gemanagte Pipeline aus: Ingest der referenzierten Korpora, Abgleich jeder Datei gegen die akademischen Manifeste und direkte Auslieferung in MKV in ihren S3-Bucket, mit laufendem Vollständigkeitsreporting.
Keine Proxies, keine Retry-Logik, keine Infrastruktur auf ihrer Seite: ein Manifest rein, ein Bucket, der sich füllt.
Ergebnisse
98.663 Videos ausgeliefert, ~32,65 TB in MKV, jede Datei gegen die Referenzmanifeste abgeglichen. Das Dataset-Team war noch in derselben Woche zurück bei der Modellarbeit.
Seit dem Backfill laufen inkrementelle Ergänzungen automatisch über dieselbe Pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Leitung Dataset-Engineering, Unternehmen für KI-gestützte visuelle Synchronisation