العملاء/شركة دبلجة بصرية بالذكاء الاصطناعي
نظرة عامةكل قصص العملاء
عميل مجهول الهوية · شعار وهمي

شركة رائدة في الدبلجة البصرية بالذكاء الاصطناعي للسينما تصنّع جمع البيانات

تدريب نماذج الدبلجة البصرية للسينما يتطلب مجموعات بيانات ضخمة وجيدة البنية لمقاطع الوجوه المتحدثة. وقد سلّم Tornado API مجموعة مرجعية أكاديمياً تضم نحو مئة ألف فيديو مباشرة إلى الـ bucket لديهم على S3، مطابَقة ومُتحقَّقاً منها، بصيغة MKV.

شركة دبلجة بصرية بالذكاء الاصطناعي
المنتجات المستخدمة
Ingestion API
Managed Datasets
الذكاء الاصطناعي وتعلم الآلة
حجم كبير
يُسلَّم إلى AWS S3

كيف بدأ الأمر

وجدوا Tornado عبر بحث في Google بينما كانوا يبحثون عن طريقة لبناء مجموعة التدريب لديهم، وتواصلوا مباشرة مع المؤسس.

التحدي

نماذج الدبلجة البصرية تتعلم من مقاطع الوجوه المتحدثة، وتحتاجها بحجم بحثي وبجودة عالية ومبنية وفق مراجع أكاديمية مثل SpeakerVid وTalkVid. وبناء مجموعة من نحو 100,000 فيديو مرجعي داخلياً كان يعني شهوراً من الهندسة على مشكلة خارجة تماماً عن نشاطهم الأساسي.

كل أسبوع يُنفَق على أدوات الاستخراج والـ proxies ومنطق إعادة المحاولة هو أسبوع لم يُنفَق على النماذج نفسها.

الحل

نفّذ Tornado التسليم كـ pipeline مُدار: استيعاب المجموعات المرجعية، ومطابقة كل ملف مع القوائم الأكاديمية، والتسليم المباشر بصيغة MKV إلى الـ bucket لديهم على S3 مع تقارير اكتمال طوال المشروع.

بلا proxies، وبلا منطق إعادة محاولة، وبلا أي بنية تحتية من جهتهم: قائمة واحدة في المدخل، وbucket يمتلئ.

النتائج

98,663 فيديو مُسلَّم، ونحو 32.65 TB بصيغة MKV، وكل ملف مطابَق مع القوائم المرجعية. وعاد فريق البيانات إلى العمل على النماذج في الأسبوع نفسه.

ومنذ عملية الاستيراد الأولى، تمر الإضافات التدريجية عبر الـ pipeline نفسه تلقائياً.

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.مسؤول هندسة البيانات، شركة دبلجة بصرية بالذكاء الاصطناعي
المزيد من قصص العملاء:Taja AIمنصة استضافة بودكاست مرئيمنصة إعادة استخدام المحتوى