Un leader del doppiaggio visivo AI per il cinema industrializza la raccolta dei dataset
Addestrare modelli di doppiaggio visivo per il cinema richiede dataset immensi e ben strutturati di video di volti parlanti. Tornado API ha consegnato un corpus con riferimenti accademici di quasi centomila video direttamente nel loro bucket S3, riconciliato, verificato, in MKV.
Come è iniziata
Hanno trovato Tornado con una ricerca su Google mentre cercavano un modo per costruire il loro corpus di training, e hanno contattato direttamente il founder.
Sfida
I modelli di doppiaggio visivo imparano da video di volti parlanti, e ne servono su scala di ricerca, in alta qualità, strutturati secondo riferimenti accademici come SpeakerVid e TalkVid. Costruire internamente un corpus di ~100.000 video referenziati significava mesi di ingegneria su un problema del tutto estraneo al loro core business.
Ogni settimana passata su scraper, proxy e logica di retry era una settimana non passata sui modelli.
Soluzione
Tornado ha eseguito la consegna come pipeline gestita: ingestione dei corpus referenziati, riconciliazione di ogni file con i manifest accademici e consegna diretta in MKV nel loro bucket S3, con reportistica sulla completezza per tutta la durata del progetto.
Nessun proxy, nessuna logica di retry, nessuna infrastruttura dalla loro parte: un manifest in ingresso, un bucket che si riempie.
Risultati
98.663 video consegnati, ~32,65 TB in MKV, ogni file riconciliato con i manifest di riferimento. Il team dataset è tornato a lavorare sui modelli nella stessa settimana.
Dopo il backfill, le aggiunte incrementali passano automaticamente dalla stessa pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Responsabile ingegneria dataset, azienda di doppiaggio visivo AI