Peneraju alih suara visual AI untuk filem mengindustrikan pengumpulan dataset
Melatih model alih suara visual untuk pawagam memerlukan dataset video wajah bercakap yang besar dan tersusun rapi. Tornado API menghantar korpus berujukan akademik hampir seratus ribu video terus ke dalam bucket S3 mereka, disemak, disahkan, dalam MKV.
Bagaimana ia bermula
Mereka menemui Tornado melalui carian Google ketika mencari cara membina korpus latihan mereka, dan terus menghubungi pengasas.
Cabaran
Model alih suara visual belajar daripada video wajah bercakap, dan ia memerlukannya pada skala penyelidikan, dalam kualiti tinggi, tersusun mengikut rujukan akademik seperti SpeakerVid dan TalkVid. Membina korpus ~100,000 video berujukan secara dalaman bermakna berbulan-bulan kejuruteraan pada masalah yang langsung di luar teras perniagaan mereka.
Setiap minggu yang dihabiskan pada scraper, proxy dan logik cubaan semula ialah seminggu yang tidak dihabiskan pada model itu sendiri.
Penyelesaian
Tornado menjalankan penghantaran itu sebagai pipeline terurus: ingestion korpus berujukan, penyemakan setiap fail dengan manifest akademik, dan penghantaran langsung dalam MKV ke bucket S3 mereka dengan laporan kelengkapan sepanjang proses.
Tiada proxy, tiada logik cubaan semula, tiada infra di pihak mereka: satu manifest masuk, satu bucket yang terus terisi.
Keputusan
98,663 video dihantar, ~32.65 TB dalam MKV, setiap fail disemak dengan manifest rujukan. Pasukan dataset kembali kepada kerja model pada minggu yang sama.
Sejak backfill itu, penambahan berperingkat berjalan melalui pipeline yang sama secara automatik.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Ketua kejuruteraan dataset, syarikat alih suara visual AI