Klienci/Firma zajmująca się dubbingiem wizualnym AI
PrzeglądWszystkie historie klientów
Zanonimizowany klient · fikcyjne logo

Lider dubbingu wizualnego AI dla kina uprzemysławia zbieranie datasetów

Trenowanie modeli dubbingu wizualnego dla kina wymaga ogromnych, dobrze ustrukturyzowanych datasetów wideo z mówiącymi twarzami. Tornado API dostarczyło korpus opisany w publikacjach naukowych, blisko sto tysięcy wideo, prosto do ich bucketa S3, uzgodniony, zweryfikowany, w MKV.

Firma zajmująca się dubbingiem wizualnym AI
Używane produkty
Ingestion API
Managed Datasets
AI i ML
Duży wolumen
Dostarcza do AWS S3

Jak to się zaczęło

Trafili na Tornado przez wyszukiwarkę Google, szukając sposobu na zbudowanie swojego korpusu treningowego, i odezwali się bezpośrednio do założyciela.

Wyzwanie

Modele dubbingu wizualnego uczą się z wideo z mówiącymi twarzami i potrzebują ich w skali badawczej, w wysokiej jakości, ustrukturyzowanych według referencji naukowych takich jak SpeakerVid czy TalkVid. Zbudowanie własnymi siłami korpusu ~100 000 opisanych wideo oznaczało miesiące pracy inżynierskiej nad problemem całkowicie spoza ich głównego biznesu.

Każdy tydzień spędzony na scraperach, proxy i logice ponowień był tygodniem nieprzepracowanym nad samymi modelami.

Rozwiązanie

Tornado poprowadziło dostawę jako zarządzany pipeline: ingest opisanych korpusów, uzgodnienie każdego pliku z manifestami naukowymi i bezpośrednie dostarczanie w MKV do ich bucketa S3, z raportowaniem kompletności przez cały czas trwania projektu.

Żadnych proxy, żadnej logiki ponowień, żadnej infrastruktury po ich stronie: jeden manifest na wejściu, jeden zapełniający się bucket.

Wyniki

98 663 dostarczonych wideo, ~32,65 TB w MKV, każdy plik uzgodniony z manifestami referencyjnymi. Zespół datasetów wrócił do pracy nad modelami jeszcze w tym samym tygodniu.

Od czasu backfillu przyrostowe uzupełnienia idą automatycznie przez ten sam pipeline.

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.Szef inżynierii datasetów, firma zajmująca się dubbingiem wizualnym AI
Więcej historii klientów:Taja AIHost podcastów wideoPlatforma repurposingu treści