Lider dubbingu wizualnego AI dla kina uprzemysławia zbieranie datasetów
Trenowanie modeli dubbingu wizualnego dla kina wymaga ogromnych, dobrze ustrukturyzowanych datasetów wideo z mówiącymi twarzami. Tornado API dostarczyło korpus opisany w publikacjach naukowych, blisko sto tysięcy wideo, prosto do ich bucketa S3, uzgodniony, zweryfikowany, w MKV.
Jak to się zaczęło
Trafili na Tornado przez wyszukiwarkę Google, szukając sposobu na zbudowanie swojego korpusu treningowego, i odezwali się bezpośrednio do założyciela.
Wyzwanie
Modele dubbingu wizualnego uczą się z wideo z mówiącymi twarzami i potrzebują ich w skali badawczej, w wysokiej jakości, ustrukturyzowanych według referencji naukowych takich jak SpeakerVid czy TalkVid. Zbudowanie własnymi siłami korpusu ~100 000 opisanych wideo oznaczało miesiące pracy inżynierskiej nad problemem całkowicie spoza ich głównego biznesu.
Każdy tydzień spędzony na scraperach, proxy i logice ponowień był tygodniem nieprzepracowanym nad samymi modelami.
Rozwiązanie
Tornado poprowadziło dostawę jako zarządzany pipeline: ingest opisanych korpusów, uzgodnienie każdego pliku z manifestami naukowymi i bezpośrednie dostarczanie w MKV do ich bucketa S3, z raportowaniem kompletności przez cały czas trwania projektu.
Żadnych proxy, żadnej logiki ponowień, żadnej infrastruktury po ich stronie: jeden manifest na wejściu, jeden zapełniający się bucket.
Wyniki
98 663 dostarczonych wideo, ~32,65 TB w MKV, każdy plik uzgodniony z manifestami referencyjnymi. Zespół datasetów wrócił do pracy nad modelami jeszcze w tym samym tygodniu.
Od czasu backfillu przyrostowe uzupełnienia idą automatycznie przez ten sam pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Szef inżynierii datasetów, firma zajmująca się dubbingiem wizualnym AI