Um líder em dublagem visual por IA para o cinema industrializa a coleta de datasets
Treinar modelos de dublagem visual para o cinema exige datasets imensos e bem estruturados de vídeos de rostos falantes. A Tornado API entregou um corpus academicamente referenciado de quase cem mil vídeos direto no bucket S3 deles, reconciliado, verificado, em MKV.
Como começou
Eles encontraram a Tornado em uma busca no Google enquanto procuravam uma forma de montar seu corpus de treinamento, e falaram diretamente com o fundador.
Desafio
Modelos de dublagem visual aprendem com vídeos de rostos falantes, e precisam deles em escala de pesquisa, em alta qualidade, estruturados segundo referências acadêmicas como SpeakerVid e TalkVid. Montar internamente um corpus de ~100.000 vídeos referenciados significava meses de engenharia em um problema totalmente fora do core business deles.
Cada semana gasta com scrapers, proxies e lógica de retry era uma semana não gasta nos próprios modelos.
Solução
A Tornado executou a entrega como um pipeline gerenciado: ingestão dos corpora referenciados, reconciliação de cada arquivo com os manifests acadêmicos e entrega direta em MKV no bucket S3 deles, com relatórios de completude ao longo do caminho.
Sem proxies, sem lógica de retry, sem infra do lado deles: um manifest entra, um bucket vai enchendo.
Resultados
98.663 vídeos entregues, ~32,65 TB em MKV, cada arquivo reconciliado com os manifests de referência. O time de datasets voltou a trabalhar nos modelos na mesma semana.
Desde o backfill, as adições incrementais passam automaticamente pelo mesmo pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Líder de engenharia de datasets, empresa de dublagem visual por IA