VBench: Respect du prompt

VBench: Respect du prompt est un benchmark public conçu par OpenGVLab, Shanghai AI Laboratory et d’autres contributeurs pour évaluer les modèles de génération vidéo. Il appartient à VBench, une suite organisée autour de plusieurs dimensions de qualité visuelle et de fidélité aux…

VBench: Respect du prompt est un benchmark public conçu par OpenGVLab, Shanghai AI Laboratory et d’autres contributeurs pour évaluer les modèles de génération vidéo. Il appartient à VBench, une suite organisée autour de plusieurs dimensions de qualité visuelle et de fidélité aux instructions.

Cette composante mesure l’alignement sémantique entre une vidéo générée et son prompt textuel en anglais. Elle examine notamment la présence des objets, les actions, les relations spatiales, les scènes et les styles demandés, afin de comparer la capacité des modèles à traduire fidèlement une consigne en vidéo.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenGVLab / Shanghai AI Laboratory et al.
Capacités mesuréesMesure dans quelle mesure une vidéo générée respecte le contenu sémantique du prompt, notamment les objets, actions, relations spatiales, scènes et styles demandés.
ModalitéVidéo
Type de questionsprompts textuels pour génération vidéo, évalués automatiquement sur l’alignement sémantique avec le prompt
Métrique d'évaluationsemantic score normalisé entre 0 et 1
AccèsPublic
Languesanglais
Taille du jeuenviron 1 746 prompts dans VBench
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (62)

#ModèleÉditeurLicenceScoreSortieFiabilité
1IPOW▫ n.d.90,0 %6 août 2025✅ Mesuré
2Vidu Q1Shengshu▫ n.d.87,9 %21 avril 2025✅ Mesuré
3JT3.5▫ n.d.84,2 %30 juillet 2025✅ Mesuré
4LumaLuma AI🔒 Propriétaire84,2 %14 janvier 2025✅ Mesuré
5IPOC▫ n.d.84,1 %14 avril 2025✅ Mesuré
6LanDiff▫ n.d.82,7 %6 août 2025✅ Mesuré
7veo-3Google▫ n.d.82,5 %21 mai 2025✅ Mesuré
8Wan2.1Qwen▫ n.d.81,0 %24 février 2025✅ Mesuré
9Open-Sora-2.0HPC-AI Tech▫ n.d.80,1 %31 mars 2025✅ Mesuré
10MiracleVision V5▫ n.d.79,4 %21 janvier 2025✅ Mesuré
11soraOpenAI🔒 Propriétaire79,3 %15 février 2024✅ Mesuré
12CogVideoX1.5-5BZhipu AI▫ n.d.79,2 %15 novembre 2024✅ Mesuré
13RepVideo▫ n.d.78,9 %16 janvier 2025✅ Mesuré
14CausVid▫ n.d.78,6 %2 janvier 2025✅ Mesuré
15AccVideo▫ n.d.78,1 %31 mars 2025✅ Mesuré
16Vchitect-2.0-2B▫ n.d.77,8 %16 septembre 2024✅ Mesuré
17MiniMax-Video-01MiniMax▫ n.d.77,7 %1 octobre 2024✅ Mesuré
18STIV▫ n.d.77,6 %19 décembre 2024✅ Mesuré
19Vchitect-2.0▫ n.d.77,1 %20 septembre 2024✅ Mesuré
20CogVideoX-5BZhipu AI▫ n.d.77,0 %4 mars 2025✅ Mesuré
21EasyAnimateV5.1▫ n.d.77,0 %22 janvier 2025✅ Mesuré
22Kling 1.6Kuaishou🔒 Propriétaire77,0 %8 mai 2025✅ Mesuré
23Jimeng▫ n.d.76,7 %15 novembre 2024✅ Mesuré
24Wan2.1-T2V-14BQwen▫ n.d.76,1 %25 juillet 2025✅ Mesuré
25CogVideoX-2BZhipu AI▫ n.d.75,8 %3 mars 2025✅ Mesuré
26Hunyuan VideoTencent▫ n.d.75,8 %22 mai 2025✅ Mesuré
27KlingKuaishou🔒 Propriétaire75,7 %1 août 2024✅ Mesuré
28Wan2.1-T2V-1.3BQwen▫ n.d.75,7 %13 mars 2025✅ Mesuré
29Gen-3Runway🔒 Propriétaire75,2 %25 juillet 2024✅ Mesuré
30ViduShengshu▫ n.d.74,0 %15 novembre 2024✅ Mesuré
31VideoCrafter-2.0▫ n.d.73,4 %19 avril 2024✅ Mesuré
32OpenSora V1.2HPC-AI Tech▫ n.d.73,4 %2 septembre 2024✅ Mesuré
33Gen-2Runway🔒 Propriétaire73,0 %20 mars 2023✅ Mesuré
34Show-1▫ n.d.73,0 %19 janvier 2024✅ Mesuré
35Wan2.2-T2V-A14BQwen▫ n.d.72,9 %18 février 2026✅ Mesuré
36VideoCrafter-1.0▫ n.d.72,2 %19 janvier 2024✅ Mesuré
37Pika-1.0Pika Labs🔒 Propriétaire71,8 %29 juillet 2024✅ Mesuré
38Step-Video-T2V▫ n.d.71,3 %13 mars 2025✅ Mesuré
39Pika BetaPika Labs🔒 Propriétaire71,3 %19 janvier 2024✅ Mesuré
40LTX-VideoLightricks▫ n.d.70,8 %2 décembre 2024✅ Mesuré
41MAGI-T2V-24B-distill▫ n.d.70,4 %6 août 2025✅ Mesuré
42LaVie▫ n.d.70,3 %23 novembre 2023✅ Mesuré
43Mochi-1Genmo▫ n.d.70,1 %7 novembre 2024✅ Mesuré
44AnimateDiff-V2▫ n.d.69,8 %3 juin 2024✅ Mesuré
45LaVie-Interpolation▫ n.d.69,3 %17 février 2024✅ Mesuré
46AnimateLCM▫ n.d.67,7 %28 juin 2024✅ Mesuré
47Latte-1▫ n.d.67,6 %5 juin 2024✅ Mesuré
48OpenSora V1.1HPC-AI Tech▫ n.d.67,4 %17 juillet 2024✅ Mesuré
49ModelScope▫ n.d.66,5 %23 novembre 2023✅ Mesuré
50OpenSoraPlan V1.1HPC-AI Tech▫ n.d.66,4 %17 juillet 2024✅ Mesuré
51AnimateDiff-V1▫ n.d.66,3 %2 août 2024✅ Mesuré
52MAGI-T2V-4.5B-distill▫ n.d.65,7 %10 juin 2025✅ Mesuré
53OpenSoraPlan V1.3HPC-AI Tech▫ n.d.65,6 %7 novembre 2024✅ Mesuré
54VideoCrafter-0.9▫ n.d.65,5 %23 novembre 2023✅ Mesuré
55HiGen▫ n.d.65,3 %20 juin 2024✅ Mesuré
56Open-SoraHPC-AI Tech▫ n.d.64,3 %20 avril 2024✅ Mesuré
57LTX-2Lightricks▫ n.d.60,3 %4 février 2026✅ Mesuré
58InstructVideo▫ n.d.56,8 %9 juillet 2024✅ Mesuré
59TF-T2V▫ n.d.56,7 %20 juin 2024✅ Mesuré
60OpenSoraPlan V1.2HPC-AI Tech▫ n.d.53,9 %29 octobre 2024✅ Mesuré
61CogVideoZhipu AI▫ n.d.46,8 %23 novembre 2023✅ Mesuré
62Mira▫ n.d.44,2 %17 juillet 2024✅ Mesuré

Classement établi sur 62 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 73,4 %.

Notre analyse

Un score élevé indique qu’un modèle restitue avec constance le contenu sémantique des prompts, au-delà de la seule qualité visuelle. L’évaluation automatique facilite une comparaison homogène sur un ensemble étendu de consignes, tandis que la mesure au moins partielle par un tiers renforce la fiabilité du classement par rapport à des résultats uniquement auto-déclarés. Cette méthode reste toutefois centrée sur les dimensions sémantiques agrégées par le semantic score. Elle ne résume donc pas, à elle seule, toutes les qualités d’une vidéo générée. La normalisation entre 0 et 1 peut aussi réduire la différenciation si plusieurs systèmes se rapprochent du plafond. Le caractère public de VBench appelle par ailleurs à considérer le risque d’exposition préalable aux prompts lors de l’interprétation des performances. Parmi les 62 modèles recensés, une médiane à 73 % et un meilleur résultat de 90 % pour IPOW montrent un écart notable entre le niveau central et la tête du classement, sans saturation complète du benchmark.


Sources des scores : vbench.