ผู้นำด้านการพากย์เสียงพร้อมภาพด้วย AI สำหรับภาพยนตร์ ยกระดับการเก็บ dataset สู่ระดับอุตสาหกรรม
การเทรนโมเดลพากย์เสียงพร้อมภาพสำหรับภาพยนตร์ต้องใช้ dataset วิดีโอใบหน้าคนพูดจำนวนมหาศาลที่มีโครงสร้างดี Tornado API ส่งมอบ corpus ที่อ้างอิงตามงานวิชาการเกือบหนึ่งแสนวิดีโอตรงเข้า S3 bucket ของพวกเขา กระทบยอดแล้ว ตรวจสอบแล้ว ในรูปแบบ MKV
จุดเริ่มต้น
พวกเขาเจอ Tornado จากการค้นหาบน Google ขณะมองหาวิธีสร้าง training corpus ของตัวเอง แล้วติดต่อผู้ก่อตั้งโดยตรง
ความท้าทาย
โมเดลพากย์เสียงพร้อมภาพเรียนรู้จากวิดีโอใบหน้าคนพูด และต้องใช้ในระดับงานวิจัย คุณภาพสูง จัดโครงสร้างตามงานอ้างอิงทางวิชาการอย่าง SpeakerVid และ TalkVid การสร้าง corpus ราว 100,000 วิดีโอที่อ้างอิงได้ด้วยตัวเอง หมายถึงงานวิศวกรรมหลายเดือนกับปัญหาที่อยู่นอกธุรกิจหลักของพวกเขาโดยสิ้นเชิง
ทุกสัปดาห์ที่หมดไปกับ scraper, proxy และตรรกะ retry คือสัปดาห์ที่ไม่ได้ใช้ไปกับตัวโมเดลเอง
โซลูชัน
Tornado รันการส่งมอบนี้เป็น pipeline แบบ managed: ดึง corpus ที่อ้างอิงไว้ กระทบยอดทุกไฟล์กับ manifest ทางวิชาการ และส่งมอบเป็น MKV ตรงเข้า S3 bucket ของพวกเขา พร้อมรายงานความครบถ้วนตลอดโครงการ
ไม่มี proxy ไม่มีตรรกะ retry ไม่มี infra ฝั่งพวกเขาเลย ส่ง manifest เข้ามาหนึ่งชุด แล้ว bucket ก็ค่อย ๆ เต็มขึ้น
ผลลัพธ์
ส่งมอบ 98,663 วิดีโอ ราว 32.65 TB ในรูปแบบ MKV ทุกไฟล์กระทบยอดตรงกับ manifest อ้างอิง ทีม dataset กลับไปทำงานกับโมเดลได้ภายในสัปดาห์เดียวกัน
หลังจาก backfill ครั้งนั้น การเพิ่มข้อมูลทีละส่วนก็วิ่งผ่าน pipeline เดียวกันโดยอัตโนมัติ
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”หัวหน้าวิศวกรรม dataset บริษัทพากย์เสียงพร้อมภาพด้วย AI