VBench: Total
VBench: Total est une suite d’évaluation créée en 2023 par la Vchitect Team et ses collaborateurs pour comparer les modèles génératifs vidéo, notamment les systèmes texte-vers-vidéo. Elle s’appuie sur des prompts en anglais et sur des métriques automatiques.
VBench: Total est une suite d’évaluation créée en 2023 par la Vchitect Team et ses collaborateurs pour comparer les modèles génératifs vidéo, notamment les systèmes texte-vers-vidéo. Elle s’appuie sur des prompts en anglais et sur des métriques automatiques.
Le benchmark synthétise plusieurs dimensions de la génération vidéo, parmi lesquelles la qualité visuelle, la cohérence temporelle, le mouvement, la composition des scènes et la fidélité au prompt. Son score total fournit ainsi une mesure agrégée destinée à situer les modèles selon leur stabilité et leur alignement sémantique.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Vchitect Team et al. |
| Capacités mesurées | Mesure la qualité et la fidélité des modèles de génération vidéo selon plusieurs dimensions, dont cohérence temporelle, qualité visuelle, mouvement, correspondance au prompt et composition de scènes. |
| Modalité | Vidéo |
| Type de questions | prompts de génération vidéo évalués par des métriques automatiques |
| Métrique d'évaluation | score agrégé normalisé entre 0 et 1 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 946 prompts |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | veo-3 | ▫ n.d. | 66,7 % | 21 mai 2025 | ✅ Mesuré | |
| 2 | JT-CV | — | ▫ n.d. | 64,6 % | 24 mars 2026 | ✅ Mesuré |
| 3 | ABot-World v0.1 | — | ▫ n.d. | 64,5 % | 21 mars 2026 | ✅ Mesuré |
| 4 | Vidu Q1 | Shengshu | ▫ n.d. | 62,7 % | 21 avril 2025 | ✅ Mesuré |
| 5 | ToMoviee-2.0 | — | ▫ n.d. | 61,8 % | 8 septembre 2025 | ✅ Mesuré |
| 6 | Wan2.1 | Qwen | ▫ n.d. | 60,2 % | 24 février 2025 | ✅ Mesuré |
| 7 | Seedance 1.0 Pro | ByteDance | ▫ n.d. | 59,8 % | 26 juin 2025 | ✅ Mesuré |
| 8 | Kling 1.6 | Kuaishou | 🔒 Propriétaire | 59,0 % | 8 mai 2025 | ✅ Mesuré |
| 9 | Sora-480p | OpenAI | 🔒 Propriétaire | 58,4 % | 28 mars 2025 | ✅ Mesuré |
| 10 | StepVideo | — | ▫ n.d. | 55,8 % | 28 mars 2025 | ✅ Mesuré |
| 11 | Hunyuan Video | Tencent | ▫ n.d. | 55,3 % | 22 mai 2025 | ✅ Mesuré |
| 12 | CogVideoX-1.5 | Zhipu AI | ▫ n.d. | 53,3 % | 28 mars 2025 | ✅ Mesuré |
Classement établi sur 12 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 60,0 %.
Notre analyse
Un score élevé sur VBench: Total indique qu’un modèle obtient de bons résultats combinés sur les différentes dimensions évaluées, plutôt qu’une excellence garantie sur chacune d’elles. L’échelle normalisée facilite les comparaisons globales, mais l’agrégation peut masquer des écarts entre qualité visuelle, mouvement, cohérence temporelle ou respect du prompt. Les résultats présentent une rigueur supérieure à de simples déclarations des fournisseurs, puisqu’ils sont au moins partiellement mesurés par un tiers, tout en restant fondés sur des métriques automatiques. La portée demeure centrée sur 946 prompts en anglais et sur les capacités couvertes par la suite. L’accès public peut également rendre les prompts connus, ce qui invite à considérer un possible effet de contamination lors de l’interprétation. Parmi les 12 modèles recensés, veo-3 arrive en tête avec 67 %, contre une médiane de 60 %. Cet écart montre un avantage mesurable du premier modèle, mais aussi un classement relativement resserré sur l’indicateur agrégé, sans saturation complète puisque le meilleur résultat reste éloigné du maximum théorique.
Sources des scores : vbench.