Một đơn vị dẫn đầu về lồng tiếng hình ảnh bằng AI cho điện ảnh công nghiệp hóa việc thu thập dataset
Huấn luyện mô hình lồng tiếng hình ảnh cho điện ảnh đòi hỏi những dataset khổng lồ và có cấu trúc tốt gồm video khuôn mặt đang nói. Tornado API đã giao một corpus được tham chiếu học thuật gồm gần một trăm nghìn video thẳng vào bucket S3 của họ, đã đối soát, đã xác minh, ở định dạng MKV.
Mọi thứ bắt đầu thế nào
Họ tìm thấy Tornado qua một lần tìm kiếm trên Google khi đang tìm cách xây dựng corpus huấn luyện, rồi liên hệ thẳng với founder.
Thách thức
Mô hình lồng tiếng hình ảnh học từ video khuôn mặt đang nói, và cần dữ liệu đó ở quy mô nghiên cứu, chất lượng cao, có cấu trúc theo các tham chiếu học thuật như SpeakerVid và TalkVid. Tự xây một corpus khoảng 100.000 video có tham chiếu đồng nghĩa với nhiều tháng kỹ thuật cho một bài toán hoàn toàn nằm ngoài hoạt động cốt lõi của họ.
Mỗi tuần dành cho scraper, proxy và logic retry là một tuần không dành cho chính các mô hình.
Giải pháp
Tornado thực hiện đợt giao này như một pipeline được quản lý: ingest các corpus có tham chiếu, đối soát từng file với manifest học thuật, và giao trực tiếp ở định dạng MKV vào bucket S3 của họ kèm báo cáo mức độ hoàn thành trong suốt quá trình.
Không proxy, không logic retry, không hạ tầng nào ở phía họ: một manifest đưa vào, một bucket đầy dần lên.
Kết quả
98.663 video đã giao, ~32,65 TB ở định dạng MKV, mỗi file đều được đối soát với manifest tham chiếu. Đội dataset quay lại làm việc với mô hình ngay trong tuần đó.
Kể từ đợt backfill, các bổ sung tăng dần đều chạy tự động qua cùng một pipeline.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Trưởng bộ phận kỹ thuật dataset, công ty lồng tiếng hình ảnh bằng AI