सिनेमा के लिए AI विज़ुअल डबिंग की एक अग्रणी कंपनी dataset संग्रह को औद्योगिक बनाती है
सिनेमा के लिए विज़ुअल डबिंग मॉडल ट्रेन करने में बोलते चेहरों के विशाल, सुव्यवस्थित वीडियो datasets लगते हैं। Tornado API ने लगभग एक लाख वीडियो का शैक्षणिक रूप से संदर्भित corpus सीधे उनके S3 bucket में डिलीवर किया, मिलान और सत्यापन के साथ, MKV में।
शुरुआत कैसे हुई
अपना training corpus बनाने का रास्ता खोजते हुए उन्होंने Tornado को Google सर्च से पाया, और सीधे फ़ाउंडर से संपर्क किया।
चुनौती
विज़ुअल डबिंग मॉडल बोलते चेहरों के वीडियो से सीखते हैं, और उन्हें यह शोध के पैमाने पर, उच्च गुणवत्ता में और SpeakerVid तथा TalkVid जैसे शैक्षणिक संदर्भों के अनुरूप संरचित चाहिए। लगभग 1,00,000 संदर्भित वीडियो का corpus खुद बनाने का मतलब था, अपने मुख्य काम से पूरी तरह बाहर की समस्या पर महीनों की इंजीनियरिंग।
scrapers, proxies और retry लॉजिक पर बीता हर हफ़्ता वह हफ़्ता था जो मॉडल पर नहीं लगा।
समाधान
Tornado ने इस डिलीवरी को एक managed pipeline की तरह चलाया: संदर्भित corpora का ingestion, हर फ़ाइल का शैक्षणिक manifests से मिलान, और पूरे प्रोजेक्ट के दौरान पूर्णता रिपोर्टिंग के साथ सीधे उनके S3 bucket में MKV डिलीवरी।
न proxies, न retry लॉजिक, उनकी तरफ़ कोई इंफ़्रा नहीं: एक manifest अंदर, एक bucket भरता हुआ।
नतीजे
98,663 वीडियो डिलीवर, MKV में ~32.65 TB, हर फ़ाइल संदर्भ manifests से मिलान की गई। dataset टीम उसी हफ़्ते मॉडल के काम पर लौट गई।
backfill के बाद से, नए जुड़ने वाले हिस्से अपने आप उसी pipeline से गुज़रते हैं।
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Dataset इंजीनियरिंग लीड, AI विज़ुअल डबिंग कंपनी