VBench: Total

VBench: Total est une suite d’évaluation créée en 2023 par la Vchitect Team et ses collaborateurs pour comparer les modèles génératifs vidéo, notamment les systèmes texte-vers-vidéo. Elle s’appuie sur des prompts en anglais et sur des métriques automatiques.

VBench: Total est une suite d’évaluation créée en 2023 par la Vchitect Team et ses collaborateurs pour comparer les modèles génératifs vidéo, notamment les systèmes texte-vers-vidéo. Elle s’appuie sur des prompts en anglais et sur des métriques automatiques.

Le benchmark synthétise plusieurs dimensions de la génération vidéo, parmi lesquelles la qualité visuelle, la cohérence temporelle, le mouvement, la composition des scènes et la fidélité au prompt. Son score total fournit ainsi une mesure agrégée destinée à situer les modèles selon leur stabilité et leur alignement sémantique.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkVchitect Team et al.
Capacités mesuréesMesure la qualité et la fidélité des modèles de génération vidéo selon plusieurs dimensions, dont cohérence temporelle, qualité visuelle, mouvement, correspondance au prompt et composition de scènes.
ModalitéVidéo
Type de questionsprompts de génération vidéo évalués par des métriques automatiques
Métrique d'évaluationscore agrégé normalisé entre 0 et 1
AccèsPublic
Languesanglais
Taille du jeu946 prompts
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1veo-3Google▫ n.d.66,7 %21 mai 2025✅ Mesuré
2JT-CV▫ n.d.64,6 %24 mars 2026✅ Mesuré
3ABot-World v0.1▫ n.d.64,5 %21 mars 2026✅ Mesuré
4Vidu Q1Shengshu▫ n.d.62,7 %21 avril 2025✅ Mesuré
5ToMoviee-2.0▫ n.d.61,8 %8 septembre 2025✅ Mesuré
6Wan2.1Qwen▫ n.d.60,2 %24 février 2025✅ Mesuré
7Seedance 1.0 ProByteDance▫ n.d.59,8 %26 juin 2025✅ Mesuré
8Kling 1.6Kuaishou🔒 Propriétaire59,0 %8 mai 2025✅ Mesuré
9Sora-480pOpenAI🔒 Propriétaire58,4 %28 mars 2025✅ Mesuré
10StepVideo▫ n.d.55,8 %28 mars 2025✅ Mesuré
11Hunyuan VideoTencent▫ n.d.55,3 %22 mai 2025✅ Mesuré
12CogVideoX-1.5Zhipu AI▫ n.d.53,3 %28 mars 2025✅ Mesuré

Classement établi sur 12 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 60,0 %.

Notre analyse

Un score élevé sur VBench: Total indique qu’un modèle obtient de bons résultats combinés sur les différentes dimensions évaluées, plutôt qu’une excellence garantie sur chacune d’elles. L’échelle normalisée facilite les comparaisons globales, mais l’agrégation peut masquer des écarts entre qualité visuelle, mouvement, cohérence temporelle ou respect du prompt. Les résultats présentent une rigueur supérieure à de simples déclarations des fournisseurs, puisqu’ils sont au moins partiellement mesurés par un tiers, tout en restant fondés sur des métriques automatiques. La portée demeure centrée sur 946 prompts en anglais et sur les capacités couvertes par la suite. L’accès public peut également rendre les prompts connus, ce qui invite à considérer un possible effet de contamination lors de l’interprétation. Parmi les 12 modèles recensés, veo-3 arrive en tête avec 67 %, contre une médiane de 60 %. Cet écart montre un avantage mesurable du premier modèle, mais aussi un classement relativement resserré sur l’indicateur agrégé, sans saturation complète puisque le meilleur résultat reste éloigné du maximum théorique.


Sources des scores : vbench.