Sinema için yapay zekâ görsel dublaj alanının lideri veri seti toplamayı endüstrileştiriyor
Sinema için görsel dublaj modelleri eğitmek, konuşan yüz videolarından oluşan devasa ve iyi yapılandırılmış veri setleri gerektirir. Tornado API, akademik olarak referanslanmış yüz bine yakın videoluk bir korpusu, mutabakatı yapılmış ve doğrulanmış şekilde, MKV olarak doğrudan S3 bucket’larına teslim etti.
Nasıl başladı
Eğitim korpuslarını oluşturmanın bir yolunu ararken Tornado’yu bir Google aramasıyla buldular ve doğrudan kurucuya ulaştılar.
Zorluk
Görsel dublaj modelleri konuşan yüz videolarından öğrenir ve bunlara araştırma ölçeğinde, yüksek kalitede, SpeakerVid ve TalkVid gibi akademik referanslara göre yapılandırılmış biçimde ihtiyaç duyar. ~100.000 referanslı videoluk bir korpusu kendi içlerinde oluşturmak, ana işlerinin tamamen dışındaki bir problem üzerinde aylarca mühendislik anlamına geliyordu.
Scraper’lara, proxy’lere ve yeniden deneme mantığına harcanan her hafta, modellerin kendisine harcanmayan bir haftaydı.
Çözüm
Tornado teslimi yönetilen bir pipeline olarak yürüttü: referanslı korpusların alınması, her dosyanın akademik manifestlerle mutabakatı ve süreç boyunca tamamlanma raporlamasıyla birlikte MKV olarak doğrudan S3 bucket’larına teslim.
Proxy yok, yeniden deneme mantığı yok, kendi taraflarında altyapı yok: bir manifest girdi, bir bucket doldu.
Sonuçlar
98.663 video teslim edildi, MKV olarak ~32,65 TB, her dosya referans manifestlerle mutabık. Veri seti ekibi aynı hafta model çalışmasına geri döndü.
Backfill’den bu yana artımlı eklemeler aynı pipeline üzerinden otomatik olarak akıyor.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Veri seti mühendisliği lideri, yapay zekâ görsel dublaj şirketi