고객 사례/AI 비주얼 더빙 기업
개요전체 고객 스토리
익명 처리 고객 · 가상 로고

영화용 AI 비주얼 더빙 선도 기업이 데이터셋 수집을 산업화했습니다

영화용 비주얼 더빙 모델을 학습시키려면 말하는 얼굴 영상으로 구성된 방대하고 잘 정돈된 데이터셋이 필요합니다. Tornado API는 학술적으로 레퍼런스된 10만 개에 가까운 영상 코퍼스를 대조와 검증을 마친 MKV 형식으로 고객사 S3 버킷에 곧바로 전송했습니다.

AI 비주얼 더빙 기업
사용 중인 제품
Ingestion API
Managed Datasets
AI & ML
대용량
전송 대상 AWS S3

시작은 이랬습니다

학습 코퍼스를 구축할 방법을 찾다가 Google 검색으로 Tornado를 발견했고, 창업자에게 직접 연락해 왔습니다.

과제

비주얼 더빙 모델은 말하는 얼굴 영상으로 학습하며, SpeakerVid와 TalkVid 같은 학술 레퍼런스에 맞춰 구조화된 고품질 데이터가 연구 규모로 필요합니다. 약 100,000개의 레퍼런스 영상 코퍼스를 사내에서 구축한다는 것은 핵심 사업과 전혀 무관한 문제에 몇 달의 엔지니어링을 쏟는다는 뜻이었습니다.

스크래퍼와 프록시, 재시도 로직에 쓴 한 주는 모델 자체에 쓰지 못한 한 주였습니다.

해결 방식

Tornado는 이 전송을 매니지드 파이프라인으로 운영했습니다. 레퍼런스 코퍼스를 수집하고, 모든 파일을 학술 매니페스트와 대조했으며, 진행 상황을 보고하면서 MKV 형식으로 고객사 S3 버킷에 직접 전송했습니다.

프록시도, 재시도 로직도, 고객사 쪽 인프라도 없었습니다. 매니페스트 하나가 들어가고 버킷 하나가 채워졌습니다.

결과

영상 98,663개, MKV 약 32.65 TB를 전송했고 모든 파일을 레퍼런스 매니페스트와 대조했습니다. 데이터셋 팀은 그 주에 바로 모델 작업으로 돌아갔습니다.

백필 이후 추가되는 증분 데이터도 같은 파이프라인을 통해 자동으로 처리됩니다.

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.데이터셋 엔지니어링 리드, AI 비주얼 더빙 기업
다른 고객 스토리:Taja AI영상 팟캐스트 호스팅 업체콘텐츠 재활용 플랫폼