Een koploper in visuele AI-nasynchronisatie voor film industrialiseert het verzamelen van datasets
Modellen voor visuele nasynchronisatie in de film trainen vraagt om enorme, goed gestructureerde datasets met video van pratende gezichten. Tornado API leverde een academisch gerefereerd corpus van bijna honderdduizend video's rechtstreeks in hun S3-bucket, verzoend, geverifieerd, in MKV.
Hoe het begon
Ze vonden Tornado via een Google-zoekopdracht toen ze zochten naar een manier om hun trainingscorpus op te bouwen, en namen rechtstreeks contact op met de oprichter.
Uitdaging
Modellen voor visuele nasynchronisatie leren van video met pratende gezichten, en die hebben ze nodig op onderzoeksschaal, in hoge kwaliteit, gestructureerd volgens academische referenties als SpeakerVid en TalkVid. Zelf een corpus van ~100.000 gerefereerde video's bouwen betekende maanden engineering aan een probleem dat volledig buiten hun kernactiviteit ligt.
Elke week die aan scrapers, proxies en retrylogica opging, was een week die niet aan de modellen zelf werd besteed.
Oplossing
Tornado voerde de levering uit als een managed pipeline: ingestie van de gerefereerde corpora, verzoening van elk bestand met de academische manifesten, en directe levering in MKV naar hun S3-bucket, met rapportage over de volledigheid gedurende het hele traject.
Geen proxies, geen retrylogica, geen infra aan hun kant: één manifest erin, één bucket die volloopt.
Resultaten
98.663 video's geleverd, ~32,65 TB in MKV, elk bestand verzoend met de referentiemanifesten. Het datasetteam ging diezelfde week weer aan de modellen werken.
Sinds de backfill lopen incrementele toevoegingen automatisch door dezelfde pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Lead dataset engineering, bedrijf in visuele AI-nasynchronisatie