شركة رائدة في الدبلجة البصرية بالذكاء الاصطناعي للسينما تصنّع جمع البيانات
تدريب نماذج الدبلجة البصرية للسينما يتطلب مجموعات بيانات ضخمة وجيدة البنية لمقاطع الوجوه المتحدثة. وقد سلّم Tornado API مجموعة مرجعية أكاديمياً تضم نحو مئة ألف فيديو مباشرة إلى الـ bucket لديهم على S3، مطابَقة ومُتحقَّقاً منها، بصيغة MKV.
كيف بدأ الأمر
وجدوا Tornado عبر بحث في Google بينما كانوا يبحثون عن طريقة لبناء مجموعة التدريب لديهم، وتواصلوا مباشرة مع المؤسس.
التحدي
نماذج الدبلجة البصرية تتعلم من مقاطع الوجوه المتحدثة، وتحتاجها بحجم بحثي وبجودة عالية ومبنية وفق مراجع أكاديمية مثل SpeakerVid وTalkVid. وبناء مجموعة من نحو 100,000 فيديو مرجعي داخلياً كان يعني شهوراً من الهندسة على مشكلة خارجة تماماً عن نشاطهم الأساسي.
كل أسبوع يُنفَق على أدوات الاستخراج والـ proxies ومنطق إعادة المحاولة هو أسبوع لم يُنفَق على النماذج نفسها.
الحل
نفّذ Tornado التسليم كـ pipeline مُدار: استيعاب المجموعات المرجعية، ومطابقة كل ملف مع القوائم الأكاديمية، والتسليم المباشر بصيغة MKV إلى الـ bucket لديهم على S3 مع تقارير اكتمال طوال المشروع.
بلا proxies، وبلا منطق إعادة محاولة، وبلا أي بنية تحتية من جهتهم: قائمة واحدة في المدخل، وbucket يمتلئ.
النتائج
98,663 فيديو مُسلَّم، ونحو 32.65 TB بصيغة MKV، وكل ملف مطابَق مع القوائم المرجعية. وعاد فريق البيانات إلى العمل على النماذج في الأسبوع نفسه.
ومنذ عملية الاستيراد الأولى، تمر الإضافات التدريجية عبر الـ pipeline نفسه تلقائياً.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”مسؤول هندسة البيانات، شركة دبلجة بصرية بالذكاء الاصطناعي