ลูกค้า/บริษัทพากย์เสียงพร้อมภาพด้วย AI
ภาพรวมเรื่องราวจากลูกค้าทั้งหมด
ลูกค้าที่ไม่เปิดเผยชื่อ · โลโก้สมมติ

ผู้นำด้านการพากย์เสียงพร้อมภาพด้วย AI สำหรับภาพยนตร์ ยกระดับการเก็บ dataset สู่ระดับอุตสาหกรรม

การเทรนโมเดลพากย์เสียงพร้อมภาพสำหรับภาพยนตร์ต้องใช้ dataset วิดีโอใบหน้าคนพูดจำนวนมหาศาลที่มีโครงสร้างดี Tornado API ส่งมอบ corpus ที่อ้างอิงตามงานวิชาการเกือบหนึ่งแสนวิดีโอตรงเข้า S3 bucket ของพวกเขา กระทบยอดแล้ว ตรวจสอบแล้ว ในรูปแบบ MKV

บริษัทพากย์เสียงพร้อมภาพด้วย AI
ผลิตภัณฑ์ที่ใช้
Ingestion API
Managed Datasets
AI และ ML
ปริมาณสูง
ส่งมอบไปยัง AWS S3

จุดเริ่มต้น

พวกเขาเจอ Tornado จากการค้นหาบน Google ขณะมองหาวิธีสร้าง training corpus ของตัวเอง แล้วติดต่อผู้ก่อตั้งโดยตรง

ความท้าทาย

โมเดลพากย์เสียงพร้อมภาพเรียนรู้จากวิดีโอใบหน้าคนพูด และต้องใช้ในระดับงานวิจัย คุณภาพสูง จัดโครงสร้างตามงานอ้างอิงทางวิชาการอย่าง SpeakerVid และ TalkVid การสร้าง corpus ราว 100,000 วิดีโอที่อ้างอิงได้ด้วยตัวเอง หมายถึงงานวิศวกรรมหลายเดือนกับปัญหาที่อยู่นอกธุรกิจหลักของพวกเขาโดยสิ้นเชิง

ทุกสัปดาห์ที่หมดไปกับ scraper, proxy และตรรกะ retry คือสัปดาห์ที่ไม่ได้ใช้ไปกับตัวโมเดลเอง

โซลูชัน

Tornado รันการส่งมอบนี้เป็น pipeline แบบ managed: ดึง corpus ที่อ้างอิงไว้ กระทบยอดทุกไฟล์กับ manifest ทางวิชาการ และส่งมอบเป็น MKV ตรงเข้า S3 bucket ของพวกเขา พร้อมรายงานความครบถ้วนตลอดโครงการ

ไม่มี proxy ไม่มีตรรกะ retry ไม่มี infra ฝั่งพวกเขาเลย ส่ง manifest เข้ามาหนึ่งชุด แล้ว bucket ก็ค่อย ๆ เต็มขึ้น

ผลลัพธ์

ส่งมอบ 98,663 วิดีโอ ราว 32.65 TB ในรูปแบบ MKV ทุกไฟล์กระทบยอดตรงกับ manifest อ้างอิง ทีม dataset กลับไปทำงานกับโมเดลได้ภายในสัปดาห์เดียวกัน

หลังจาก backfill ครั้งนั้น การเพิ่มข้อมูลทีละส่วนก็วิ่งผ่าน pipeline เดียวกันโดยอัตโนมัติ

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.หัวหน้าวิศวกรรม dataset บริษัทพากย์เสียงพร้อมภาพด้วย AI
เรื่องราวจากลูกค้ารายอื่น:Taja AIผู้ให้บริการโฮสต์ podcast วิดีโอแพลตฟอร์มนำคอนเทนต์กลับมาใช้ใหม่