Clients/Entreprise de doublage visuel par IA
Vue d’ensembleTous les témoignages clients
Client anonymisé · logo fictif

Un leader du doublage visuel par IA pour le cinéma industrialise la collecte de datasets

Entraîner des modèles de doublage visuel pour le cinéma exige d’immenses datasets bien structurés de vidéos de visages parlants. Tornado API a livré un corpus référencé académiquement de près de cent mille vidéos directement dans leur bucket S3, réconcilié, vérifié, en MKV.

Entreprise de doublage visuel par IA
Produits utilisés
Ingestion API
Managed Datasets
IA & ML
Gros volumes
Livre vers AWS S3

Comment ça a commencé

Ils ont trouvé Tornado via une recherche Google en cherchant un moyen de constituer leur corpus d’entraînement, et ont contacté directement le fondateur.

Défi

Les modèles de doublage visuel apprennent à partir de vidéos de visages parlants, et il leur en faut à l’échelle de la recherche, en haute qualité, structurées selon des références académiques comme SpeakerVid et TalkVid. Constituer en interne un corpus de ~100 000 vidéos référencées signifiait des mois d’ingénierie sur un problème totalement étranger à leur cœur de métier.

Chaque semaine passée sur les scrapers, les proxies et la logique de retry était une semaine non passée sur les modèles eux-mêmes.

Solution

Tornado a exécuté la livraison comme un pipeline géré : ingestion des corpus référencés, réconciliation de chaque fichier avec les manifestes académiques, et livraison directe en MKV dans leur bucket S3 avec un reporting de complétude tout au long du projet.

Pas de proxies, pas de logique de retry, aucune infra de leur côté : un manifeste en entrée, un bucket qui se remplit.

Résultats

98 663 vidéos livrées, ~32,65 To en MKV, chaque fichier réconcilié avec les manifestes de référence. L’équipe datasets est retournée travailler sur les modèles la semaine même.

Depuis le backfill, les ajouts incrémentaux passent automatiquement par le même pipeline.

We needed a 30 TB training corpus delivered to one bucket. It landed in days, organized, verified, with zero babysitting from our side.Responsable ingénierie datasets, entreprise de doublage visuel par IA
Plus de témoignages clients :Taja AIHébergeur de podcasts vidéoPlateforme de réutilisation de contenu