Лидер ИИ-дубляжа для кино поставил сбор датасетов на поток
Обучение моделей визуального дубляжа для кино требует огромных, хорошо структурированных датасетов с видео говорящих лиц. Tornado API доставил академически описанный корпус почти из ста тысяч видео прямо в их bucket S3, сверенный, проверенный, в MKV.
Как всё началось
Они нашли Tornado через поиск Google, когда искали способ собрать обучающий корпус, и написали основателю напрямую.
Проблема
Модели визуального дубляжа учатся на видео говорящих лиц, и им нужен исследовательский масштаб, высокое качество и структура по академическим наборам вроде SpeakerVid и TalkVid. Собрать корпус примерно из 100 000 описанных видео своими силами означало месяцы инженерной работы над задачей, полностью посторонней их основному бизнесу.
Каждая неделя, потраченная на скраперы, прокси и логику повторов, была неделей, не потраченной на сами модели.
Решение
Tornado выполнил доставку как управляемый пайплайн: загрузка описанных корпусов, сверка каждого файла с академическими манифестами и прямая доставка в MKV в их bucket S3 с отчётностью о полноте на всём протяжении проекта.
Никаких прокси, никакой логики повторов, никакой инфраструктуры с их стороны: манифест на входе, наполняющийся bucket на выходе.
Результаты
98 663 видео доставлено, ~32,65 ТБ в MKV, каждый файл сверен с эталонными манифестами. Команда датасетов вернулась к работе над моделями на той же неделе.
После бэкфилла инкрементальные добавления идут через тот же пайплайн автоматически.
“We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.”Руководитель инженерии датасетов, компания ИИ-дубляжа