Un líder del doblaje visual con IA para cine industrializa la recopilación de datasets
Entrenar modelos de doblaje visual para cine exige datasets inmensos y bien estructurados de vídeos de rostros hablando. Tornado API entregó un corpus con referencias académicas de casi cien mil vídeos directamente en su bucket S3, conciliado, verificado, en MKV.
Cómo empezó
Encontraron Tornado en una búsqueda de Google mientras buscaban cómo construir su corpus de entrenamiento, y contactaron directamente al fundador.
Desafío
Los modelos de doblaje visual aprenden de vídeos de rostros hablando, y los necesitan a escala de investigación, en alta calidad, estructurados según referencias académicas como SpeakerVid y TalkVid. Construir internamente un corpus de ~100,000 vídeos referenciados significaba meses de ingeniería en un problema totalmente ajeno a su negocio principal.
Cada semana dedicada a scrapers, proxies y lógica de reintentos era una semana no dedicada a los propios modelos.
Solución
Tornado ejecutó la entrega como un pipeline gestionado: ingesta de los corpus referenciados, conciliación de cada archivo contra los manifiestos académicos y entrega directa en MKV a su bucket S3, con reportes de completitud durante todo el proyecto.
Sin proxies, sin lógica de reintentos, sin infraestructura de su lado: un manifiesto entra, un bucket se va llenando.
Resultados
98,663 vídeos entregados, ~32.65 TB en MKV, cada archivo conciliado contra los manifiestos de referencia. El equipo de datasets volvió a trabajar en los modelos esa misma semana.
Desde el backfill, las adiciones incrementales pasan automáticamente por el mismo pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Responsable de ingeniería de datasets, empresa de doblaje visual con IA