CogVideoX-2B

CogVideoX-2B est un modèle de génération vidéo publié par Zhipu AI le 3 mars 2025. Il se positionne comme un outil de création de séquences pour la production audiovisuelle, la publicité et le prototypage de concepts.

CogVideoX-2B est un modèle de génération vidéo publié par Zhipu AI le 3 mars 2025. Il se positionne comme un outil de création de séquences pour la production audiovisuelle, la publicité et le prototypage de concepts.

À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA vidéo. Ses résultats VBench le placent globalement en milieu de tableau, avec un profil davantage orienté vers la cohérence des séquences que vers une qualité visuelle de premier plan.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération de vidéos
ÉditeurZhipu AI
Poids▫ n.d.
Date de sortie3 mars 2025

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
VBench: Stabilité temporelle98,9 %34ᵉ / 62vbench✅ Mesuré
VBench: Actions humaines98,0 %8ᵉ / 62vbench✅ Mesuré
VBench: Fluidité du mouvement97,7 %45ᵉ / 62vbench✅ Mesuré
VBench: Cohérence du sujet96,8 %28ᵉ / 62vbench✅ Mesuré
VBench: Qualité visuelle82,2 %41ᵉ / 62vbench✅ Mesuré
VBench: Total80,9 %33ᵉ / 62vbench✅ Mesuré
VBench: Respect du prompt75,8 %25ᵉ / 62vbench✅ Mesuré
VBench: Qualité d'image61,7 %50ᵉ / 62vbench✅ Mesuré
VBench: Qualité esthétique60,8 %40ᵉ / 62vbench✅ Mesuré
VBench: Amplitude du mouvement59,9 %33ᵉ / 62vbench✅ Mesuré

Scores objectifs mesurés par VBench (suite d'évaluation automatique de la génération vidéo), en pourcentage (plus haut = mieux). Le rang situe le modèle parmi les modèles vidéo évalués sur la même dimension.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

VBench: Stabilité temporelle

Pika Beta100 %
IPOW100 %
MAGI-T2V-4.5B-distill100 %
Latte-199 %
▶ CogVideoX-2B99 %
sora99 %

VBench: Actions humaines

CausVid100 %
Vidu Q1100 %
RepVideo98 %
▶ CogVideoX-2B98 %
JT3.597 %

Notre analyse

Forces. CogVideoX-2B se distingue surtout sur les actions humaines, une dimension où il figure dans le haut du classement VBench. La cohérence du sujet reste correcte et se situe dans la première moitié du tableau. La stabilité temporelle obtient un score brut très élevé, mais cette épreuve plafonne et départage peu les modèles. Ces résultats indiquent une aptitude à préserver les principaux éléments d’une scène au fil des images.

Limites et points d’attention. La qualité visuelle se place en retrait, ce qui limite l’intérêt du modèle pour des publicités finalisées ou des productions exigeant un rendu soigné. La fluidité du mouvement affiche elle aussi un score brut élevé, mais son rang reste faible dans un benchmark saturé. Le résultat total se situe au milieu du classement VBench. L’ancienneté du modèle renforce le risque d’un décalage face aux générations plus récentes. Usages pertinents : prototypage rapide, prévisualisation de scènes et production de brouillons vidéo avant une finition avec un modèle plus performant.


Sources des données : LLM-Stats (llm-stats.com).