ग्राहक/AI विज़ुअल डबिंग कंपनी
सारांशग्राहकों की सभी कहानियाँ
अनाम ग्राहक · काल्पनिक लोगो

सिनेमा के लिए AI विज़ुअल डबिंग की एक अग्रणी कंपनी dataset संग्रह को औद्योगिक बनाती है

सिनेमा के लिए विज़ुअल डबिंग मॉडल ट्रेन करने में बोलते चेहरों के विशाल, सुव्यवस्थित वीडियो datasets लगते हैं। Tornado API ने लगभग एक लाख वीडियो का शैक्षणिक रूप से संदर्भित corpus सीधे उनके S3 bucket में डिलीवर किया, मिलान और सत्यापन के साथ, MKV में।

AI विज़ुअल डबिंग कंपनी
इस्तेमाल किए गए products
Ingestion API
Managed Datasets
AI और ML
बड़ा volume
डिलीवरी यहाँ AWS S3

शुरुआत कैसे हुई

अपना training corpus बनाने का रास्ता खोजते हुए उन्होंने Tornado को Google सर्च से पाया, और सीधे फ़ाउंडर से संपर्क किया।

चुनौती

विज़ुअल डबिंग मॉडल बोलते चेहरों के वीडियो से सीखते हैं, और उन्हें यह शोध के पैमाने पर, उच्च गुणवत्ता में और SpeakerVid तथा TalkVid जैसे शैक्षणिक संदर्भों के अनुरूप संरचित चाहिए। लगभग 1,00,000 संदर्भित वीडियो का corpus खुद बनाने का मतलब था, अपने मुख्य काम से पूरी तरह बाहर की समस्या पर महीनों की इंजीनियरिंग।

scrapers, proxies और retry लॉजिक पर बीता हर हफ़्ता वह हफ़्ता था जो मॉडल पर नहीं लगा।

समाधान

Tornado ने इस डिलीवरी को एक managed pipeline की तरह चलाया: संदर्भित corpora का ingestion, हर फ़ाइल का शैक्षणिक manifests से मिलान, और पूरे प्रोजेक्ट के दौरान पूर्णता रिपोर्टिंग के साथ सीधे उनके S3 bucket में MKV डिलीवरी।

न proxies, न retry लॉजिक, उनकी तरफ़ कोई इंफ़्रा नहीं: एक manifest अंदर, एक bucket भरता हुआ।

नतीजे

98,663 वीडियो डिलीवर, MKV में ~32.65 TB, हर फ़ाइल संदर्भ manifests से मिलान की गई। dataset टीम उसी हफ़्ते मॉडल के काम पर लौट गई।

backfill के बाद से, नए जुड़ने वाले हिस्से अपने आप उसी pipeline से गुज़रते हैं।

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.Dataset इंजीनियरिंग लीड, AI विज़ुअल डबिंग कंपनी
ग्राहकों की और कहानियाँ:Taja AIवीडियो podcast होस्टकंटेंट रीपर्पज़िंग प्लेटफ़ॉर्म