VBench: Respect du prompt
VBench: Respect du prompt est un benchmark public conçu par OpenGVLab, Shanghai AI Laboratory et d’autres contributeurs pour évaluer les modèles de génération vidéo. Il appartient à VBench, une suite organisée autour de plusieurs dimensions de qualité visuelle et de fidélité aux…
VBench: Respect du prompt est un benchmark public conçu par OpenGVLab, Shanghai AI Laboratory et d’autres contributeurs pour évaluer les modèles de génération vidéo. Il appartient à VBench, une suite organisée autour de plusieurs dimensions de qualité visuelle et de fidélité aux instructions.
Cette composante mesure l’alignement sémantique entre une vidéo générée et son prompt textuel en anglais. Elle examine notamment la présence des objets, les actions, les relations spatiales, les scènes et les styles demandés, afin de comparer la capacité des modèles à traduire fidèlement une consigne en vidéo.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenGVLab / Shanghai AI Laboratory et al. |
| Capacités mesurées | Mesure dans quelle mesure une vidéo générée respecte le contenu sémantique du prompt, notamment les objets, actions, relations spatiales, scènes et styles demandés. |
| Modalité | Vidéo |
| Type de questions | prompts textuels pour génération vidéo, évalués automatiquement sur l’alignement sémantique avec le prompt |
| Métrique d'évaluation | semantic score normalisé entre 0 et 1 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | environ 1 746 prompts dans VBench |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (62)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | IPOW | — | ▫ n.d. | 90,0 % | 6 août 2025 | ✅ Mesuré |
| 2 | Vidu Q1 | Shengshu | ▫ n.d. | 87,9 % | 21 avril 2025 | ✅ Mesuré |
| 3 | JT3.5 | — | ▫ n.d. | 84,2 % | 30 juillet 2025 | ✅ Mesuré |
| 4 | Luma | Luma AI | 🔒 Propriétaire | 84,2 % | 14 janvier 2025 | ✅ Mesuré |
| 5 | IPOC | — | ▫ n.d. | 84,1 % | 14 avril 2025 | ✅ Mesuré |
| 6 | LanDiff | — | ▫ n.d. | 82,7 % | 6 août 2025 | ✅ Mesuré |
| 7 | veo-3 | ▫ n.d. | 82,5 % | 21 mai 2025 | ✅ Mesuré | |
| 8 | Wan2.1 | Qwen | ▫ n.d. | 81,0 % | 24 février 2025 | ✅ Mesuré |
| 9 | Open-Sora-2.0 | HPC-AI Tech | ▫ n.d. | 80,1 % | 31 mars 2025 | ✅ Mesuré |
| 10 | MiracleVision V5 | — | ▫ n.d. | 79,4 % | 21 janvier 2025 | ✅ Mesuré |
| 11 | sora | OpenAI | 🔒 Propriétaire | 79,3 % | 15 février 2024 | ✅ Mesuré |
| 12 | CogVideoX1.5-5B | Zhipu AI | ▫ n.d. | 79,2 % | 15 novembre 2024 | ✅ Mesuré |
| 13 | RepVideo | — | ▫ n.d. | 78,9 % | 16 janvier 2025 | ✅ Mesuré |
| 14 | CausVid | — | ▫ n.d. | 78,6 % | 2 janvier 2025 | ✅ Mesuré |
| 15 | AccVideo | — | ▫ n.d. | 78,1 % | 31 mars 2025 | ✅ Mesuré |
| 16 | Vchitect-2.0-2B | — | ▫ n.d. | 77,8 % | 16 septembre 2024 | ✅ Mesuré |
| 17 | MiniMax-Video-01 | MiniMax | ▫ n.d. | 77,7 % | 1 octobre 2024 | ✅ Mesuré |
| 18 | STIV | — | ▫ n.d. | 77,6 % | 19 décembre 2024 | ✅ Mesuré |
| 19 | Vchitect-2.0 | — | ▫ n.d. | 77,1 % | 20 septembre 2024 | ✅ Mesuré |
| 20 | CogVideoX-5B | Zhipu AI | ▫ n.d. | 77,0 % | 4 mars 2025 | ✅ Mesuré |
| 21 | EasyAnimateV5.1 | — | ▫ n.d. | 77,0 % | 22 janvier 2025 | ✅ Mesuré |
| 22 | Kling 1.6 | Kuaishou | 🔒 Propriétaire | 77,0 % | 8 mai 2025 | ✅ Mesuré |
| 23 | Jimeng | — | ▫ n.d. | 76,7 % | 15 novembre 2024 | ✅ Mesuré |
| 24 | Wan2.1-T2V-14B | Qwen | ▫ n.d. | 76,1 % | 25 juillet 2025 | ✅ Mesuré |
| 25 | CogVideoX-2B | Zhipu AI | ▫ n.d. | 75,8 % | 3 mars 2025 | ✅ Mesuré |
| 26 | Hunyuan Video | Tencent | ▫ n.d. | 75,8 % | 22 mai 2025 | ✅ Mesuré |
| 27 | Kling | Kuaishou | 🔒 Propriétaire | 75,7 % | 1 août 2024 | ✅ Mesuré |
| 28 | Wan2.1-T2V-1.3B | Qwen | ▫ n.d. | 75,7 % | 13 mars 2025 | ✅ Mesuré |
| 29 | Gen-3 | Runway | 🔒 Propriétaire | 75,2 % | 25 juillet 2024 | ✅ Mesuré |
| 30 | Vidu | Shengshu | ▫ n.d. | 74,0 % | 15 novembre 2024 | ✅ Mesuré |
| 31 | VideoCrafter-2.0 | — | ▫ n.d. | 73,4 % | 19 avril 2024 | ✅ Mesuré |
| 32 | OpenSora V1.2 | HPC-AI Tech | ▫ n.d. | 73,4 % | 2 septembre 2024 | ✅ Mesuré |
| 33 | Gen-2 | Runway | 🔒 Propriétaire | 73,0 % | 20 mars 2023 | ✅ Mesuré |
| 34 | Show-1 | — | ▫ n.d. | 73,0 % | 19 janvier 2024 | ✅ Mesuré |
| 35 | Wan2.2-T2V-A14B | Qwen | ▫ n.d. | 72,9 % | 18 février 2026 | ✅ Mesuré |
| 36 | VideoCrafter-1.0 | — | ▫ n.d. | 72,2 % | 19 janvier 2024 | ✅ Mesuré |
| 37 | Pika-1.0 | Pika Labs | 🔒 Propriétaire | 71,8 % | 29 juillet 2024 | ✅ Mesuré |
| 38 | Step-Video-T2V | — | ▫ n.d. | 71,3 % | 13 mars 2025 | ✅ Mesuré |
| 39 | Pika Beta | Pika Labs | 🔒 Propriétaire | 71,3 % | 19 janvier 2024 | ✅ Mesuré |
| 40 | LTX-Video | Lightricks | ▫ n.d. | 70,8 % | 2 décembre 2024 | ✅ Mesuré |
| 41 | MAGI-T2V-24B-distill | — | ▫ n.d. | 70,4 % | 6 août 2025 | ✅ Mesuré |
| 42 | LaVie | — | ▫ n.d. | 70,3 % | 23 novembre 2023 | ✅ Mesuré |
| 43 | Mochi-1 | Genmo | ▫ n.d. | 70,1 % | 7 novembre 2024 | ✅ Mesuré |
| 44 | AnimateDiff-V2 | — | ▫ n.d. | 69,8 % | 3 juin 2024 | ✅ Mesuré |
| 45 | LaVie-Interpolation | — | ▫ n.d. | 69,3 % | 17 février 2024 | ✅ Mesuré |
| 46 | AnimateLCM | — | ▫ n.d. | 67,7 % | 28 juin 2024 | ✅ Mesuré |
| 47 | Latte-1 | — | ▫ n.d. | 67,6 % | 5 juin 2024 | ✅ Mesuré |
| 48 | OpenSora V1.1 | HPC-AI Tech | ▫ n.d. | 67,4 % | 17 juillet 2024 | ✅ Mesuré |
| 49 | ModelScope | — | ▫ n.d. | 66,5 % | 23 novembre 2023 | ✅ Mesuré |
| 50 | OpenSoraPlan V1.1 | HPC-AI Tech | ▫ n.d. | 66,4 % | 17 juillet 2024 | ✅ Mesuré |
| 51 | AnimateDiff-V1 | — | ▫ n.d. | 66,3 % | 2 août 2024 | ✅ Mesuré |
| 52 | MAGI-T2V-4.5B-distill | — | ▫ n.d. | 65,7 % | 10 juin 2025 | ✅ Mesuré |
| 53 | OpenSoraPlan V1.3 | HPC-AI Tech | ▫ n.d. | 65,6 % | 7 novembre 2024 | ✅ Mesuré |
| 54 | VideoCrafter-0.9 | — | ▫ n.d. | 65,5 % | 23 novembre 2023 | ✅ Mesuré |
| 55 | HiGen | — | ▫ n.d. | 65,3 % | 20 juin 2024 | ✅ Mesuré |
| 56 | Open-Sora | HPC-AI Tech | ▫ n.d. | 64,3 % | 20 avril 2024 | ✅ Mesuré |
| 57 | LTX-2 | Lightricks | ▫ n.d. | 60,3 % | 4 février 2026 | ✅ Mesuré |
| 58 | InstructVideo | — | ▫ n.d. | 56,8 % | 9 juillet 2024 | ✅ Mesuré |
| 59 | TF-T2V | — | ▫ n.d. | 56,7 % | 20 juin 2024 | ✅ Mesuré |
| 60 | OpenSoraPlan V1.2 | HPC-AI Tech | ▫ n.d. | 53,9 % | 29 octobre 2024 | ✅ Mesuré |
| 61 | CogVideo | Zhipu AI | ▫ n.d. | 46,8 % | 23 novembre 2023 | ✅ Mesuré |
| 62 | Mira | — | ▫ n.d. | 44,2 % | 17 juillet 2024 | ✅ Mesuré |
Classement établi sur 62 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 73,4 %.
Notre analyse
Un score élevé indique qu’un modèle restitue avec constance le contenu sémantique des prompts, au-delà de la seule qualité visuelle. L’évaluation automatique facilite une comparaison homogène sur un ensemble étendu de consignes, tandis que la mesure au moins partielle par un tiers renforce la fiabilité du classement par rapport à des résultats uniquement auto-déclarés. Cette méthode reste toutefois centrée sur les dimensions sémantiques agrégées par le semantic score. Elle ne résume donc pas, à elle seule, toutes les qualités d’une vidéo générée. La normalisation entre 0 et 1 peut aussi réduire la différenciation si plusieurs systèmes se rapprochent du plafond. Le caractère public de VBench appelle par ailleurs à considérer le risque d’exposition préalable aux prompts lors de l’interprétation des performances. Parmi les 62 modèles recensés, une médiane à 73 % et un meilleur résultat de 90 % pour IPOW montrent un écart notable entre le niveau central et la tête du classement, sans saturation complète du benchmark.
Sources des scores : vbench.