Pemimpin di bidang dubbing visual AI untuk film mengindustrialisasi pengumpulan dataset
Melatih model dubbing visual untuk sinema membutuhkan dataset video wajah berbicara yang sangat besar dan tertata rapi. Tornado API mengirimkan korpus berujuk akademik berisi hampir seratus ribu video langsung ke bucket S3 mereka, direkonsiliasi, diverifikasi, dalam format MKV.
Bagaimana ini bermula
Mereka menemukan Tornado lewat pencarian Google saat mencari cara membangun korpus pelatihan mereka, lalu menghubungi founder secara langsung.
Tantangan
Model dubbing visual belajar dari video wajah berbicara, dan mereka membutuhkannya pada skala riset, dalam kualitas tinggi, tertata mengikuti rujukan akademik seperti SpeakerVid dan TalkVid. Membangun korpus berisi ~100.000 video berujuk secara internal berarti berbulan-bulan pekerjaan engineering pada masalah yang sepenuhnya di luar bisnis inti mereka.
Setiap minggu yang dihabiskan untuk scraper, proxy, dan logika retry adalah satu minggu yang tidak dihabiskan untuk model itu sendiri.
Solusi
Tornado menjalankan pengiriman ini sebagai pipeline terkelola: ingestion korpus berujuk, rekonsiliasi setiap file terhadap manifest akademik, dan pengiriman langsung dalam format MKV ke bucket S3 mereka dengan pelaporan kelengkapan sepanjang prosesnya.
Tanpa proxy, tanpa logika retry, tanpa infrastruktur di sisi mereka: satu manifest masuk, satu bucket yang terisi.
Hasil
98.663 video terkirim, ~32,65 TB dalam MKV, setiap file direkonsiliasi terhadap manifest rujukan. Tim dataset kembali mengerjakan model pada minggu yang sama.
Sejak backfill itu, penambahan inkremental berjalan otomatis melalui pipeline yang sama.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Dataset engineering lead, perusahaan dubbing visual AI