VBench: Créativité (VBench 2.0)
VBench: Créativité (VBench 2.0), créé par Vchitect et al., est un benchmark consacré aux modèles de génération vidéo. À partir de prompts textuels en anglais, il évalue automatiquement leur capacité à produire des vidéos créatives, originales et variées.
VBench: Créativité (VBench 2.0), créé par Vchitect et al., est un benchmark consacré aux modèles de génération vidéo. À partir de prompts textuels en anglais, il évalue automatiquement leur capacité à produire des vidéos créatives, originales et variées.
Cette composante de VBench 2.0 se concentre sur le caractère inventif ou non conventionnel des résultats générés. Elle complète les autres dimensions de qualité et d’alignement de la suite en fournissant un indicateur normalisé permettant de comparer la créativité des modèles vidéo.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Vchitect et al. |
| Capacités mesurées | Mesure la capacité d’un modèle de génération vidéo à produire des vidéos créatives, originales et variées à partir de prompts textuels. |
| Modalité | Vidéo |
| Type de questions | prompts textuels de génération vidéo évalués automatiquement |
| Métrique d'évaluation | score automatisé normalisé de créativité, sur une échelle 0–1 |
| Accès | Public |
| Langues | anglais |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | veo-3 | ▫ n.d. | 60,9 % | 21 mai 2025 | ✅ Mesuré | |
| 2 | Sora-480p | OpenAI | 🔒 Propriétaire | 60,6 % | 28 mars 2025 | ✅ Mesuré |
| 3 | Vidu Q1 | Shengshu | ▫ n.d. | 56,5 % | 21 avril 2025 | ✅ Mesuré |
| 4 | ABot-World v0.1 | — | ▫ n.d. | 55,3 % | 21 mars 2026 | ✅ Mesuré |
| 5 | Wan2.1 | Qwen | ▫ n.d. | 55,2 % | 24 février 2025 | ✅ Mesuré |
| 6 | Seedance 1.0 Pro | ByteDance | ▫ n.d. | 53,0 % | 26 juin 2025 | ✅ Mesuré |
| 7 | JT-CV | — | ▫ n.d. | 51,8 % | 24 mars 2026 | ✅ Mesuré |
| 8 | StepVideo | — | ▫ n.d. | 51,3 % | 28 mars 2025 | ✅ Mesuré |
| 9 | Kling 1.6 | Kuaishou | 🔒 Propriétaire | 48,6 % | 8 mai 2025 | ✅ Mesuré |
| 10 | ToMoviee-2.0 | — | ▫ n.d. | 46,0 % | 8 septembre 2025 | ✅ Mesuré |
| 11 | CogVideoX-1.5 | Zhipu AI | ▫ n.d. | 43,6 % | 28 mars 2025 | ✅ Mesuré |
| 12 | Hunyuan Video | Tencent | ▫ n.d. | 41,8 % | 22 mai 2025 | ✅ Mesuré |
Classement établi sur 12 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 52,4 %.
Notre analyse
Un score élevé indique qu’un modèle produit, selon l’évaluation automatisée, des vidéos jugées plus inventives, originales ou non conventionnelles à partir des prompts proposés. Cette mesure reste circonscrite à la définition opérationnelle de la créativité retenue par VBench 2.0 et à des requêtes en anglais. Elle ne résume donc pas, à elle seule, toutes les dimensions de qualité ou d’alignement d’un générateur vidéo.
La fiabilité est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt que seulement auto-déclarés par les fournisseurs. L’automatisation favorise une comparaison homogène, mais ramène nécessairement une notion subjective comme la créativité à un score normalisé. L’accès public invite aussi à considérer le risque de contamination lors de l’interprétation des performances. Sur les douze modèles évalués, veo-3 de Google atteint 61 %, contre une médiane de 52 %. Cet écart montre un avantage mesurable du premier modèle, sans signe de saturation au sommet de l’échelle 0–1. Le classement distingue ainsi les modèles sur cette dimension précise, et non sur l’ensemble de leurs capacités vidéo.
Sources des scores : vbench.