客户/AI 视觉配音公司
概览全部客户案例
客户已匿名 · 虚构 logo

一家电影 AI 视觉配音领域的头部公司把数据集采集工业化

训练面向电影的视觉配音模型,需要海量且结构良好的说话人面部视频数据集。Tornado API 把一个近十万个视频、有学术引用的语料库直接交付进他们的 S3 bucket,已核对、已校验,MKV 格式。

AI 视觉配音公司
使用的产品
Ingestion API
Managed Datasets
AI 与 ML
大用量
交付到 AWS S3

合作是怎么开始的

他们在找搭建训练语料库的办法时通过 Google 搜索找到了 Tornado,并直接联系了创始人。

挑战

视觉配音模型要从说话人面部视频中学习,而且需要研究级规模、高质量、并按 SpeakerVid 和 TalkVid 这类学术参考构建的数据。自己在内部搭一个约 10 万个视频的引用语料库,意味着几个月的工程投入,而这件事完全不在他们的核心业务里。

每一周花在爬虫、proxy 和重试逻辑上的时间,都是没有花在模型本身上的时间。

方案

Tornado 以托管管道的方式完成了这次交付:采集这些被引用的语料、把每一个文件与学术清单核对,并以 MKV 格式直接交付到他们的 S3 bucket,过程中持续同步完成度报告。

没有 proxy,没有重试逻辑,他们这边没有任何基础设施:给一份清单,看着一个 bucket 被填满。

结果

交付 98,663 个视频、约 32.65 TB 的 MKV,每个文件都与参考清单核对一致。数据集团队当周就回到了模型工作上。

自这次回填之后,增量补充也自动走同一条管道。

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.数据集工程负责人,AI 视觉配音公司
更多客户案例:Taja AI视频播客托管商内容再利用平台