CogVideoX-5B

CogVideoX-5B est un modèle de génération vidéo de Zhipu AI, évalué en text-to-video. Son positionnement intermédiaire le destine surtout à la création de séquences de travail, à la prévisualisation publicitaire et au prototypage de concepts.

CogVideoX-5B est un modèle de génération vidéo de Zhipu AI, évalué en text-to-video. Son positionnement intermédiaire le destine surtout à la création de séquences de travail, à la prévisualisation publicitaire et au prototypage de concepts.

Sorti le 4 mars 2025, il approche un an d’ancienneté, une durée très longue à l’échelle de l’IA. Il doit être comparé aux modèles de sa période et paraît probablement dépassé par les générations récentes. Les modèles de cet âge sont aussi souvent retirés des catalogues.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération de vidéos
ÉditeurZhipu AI
Poids▫ n.d.
Date de sortie4 mars 2025

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
VBench: Actions humaines99,4 %3ᵉ / 62vbench✅ Mesuré
VBench: Stabilité temporelle98,7 %40ᵉ / 62vbench✅ Mesuré
VBench: Fluidité du mouvement96,9 %51ᵉ / 62vbench✅ Mesuré
VBench: Cohérence du sujet96,2 %37ᵉ / 62vbench✅ Mesuré
VBench: Qualité visuelle82,8 %31ᵉ / 62vbench✅ Mesuré
VBench: Total81,6 %31ᵉ / 62vbench✅ Mesuré
VBench: Respect du prompt77,0 %20ᵉ / 62vbench✅ Mesuré
VBench: Amplitude du mouvement71,0 %17ᵉ / 62vbench✅ Mesuré
VBench: Qualité d'image62,9 %44ᵉ / 62vbench✅ Mesuré
VBench: Qualité esthétique62,0 %33ᵉ / 62vbench✅ Mesuré

Scores objectifs mesurés par VBench (suite d'évaluation automatique de la génération vidéo), en pourcentage (plus haut = mieux). Le rang situe le modèle parmi les modèles vidéo évalués sur la même dimension.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

VBench: Actions humaines

CausVid100 %
Vidu Q1100 %
IPOC99 %
veo-399 %
▶ CogVideoX-5B99 %
Wan2.199 %

VBench: Stabilité temporelle

Pika Beta100 %
IPOW100 %
MAGI-T2V-4.5B-distill100 %
AnimateDiff-V299 %
▶ CogVideoX-5B99 %
Luma99 %

Classements Arena (Elo)

Arena Text-to-Video · 129 modèles classés

RangModèleElo
1ᵉgemini-omni-flash1527
2ᵉDreamina Seedance 2.0 720p1482
3ᵉmuse-video1459
126ᵉStep-Video-T2V948
127ᵉKrea Realtime912
128ᵉCogVideoX-5B852
129ᵉPyramid Flow813

Notre analyse

Forces. Dans VBench, les actions humaines constituent son principal point fort et le placent près de la tête du classement. Ce résultat doit être relativisé, car le benchmark plafonne sur cette dimension et départage mal les modèles. La qualité visuelle et le score total se situent au milieu du tableau. La cohérence du sujet reste correcte, sans distinguer CogVideoX-5B des meilleures solutions.

Limites et points d’attention. La fluidité du mouvement est en retrait du classement VBench malgré un score brut élevé. La stabilité temporelle et la cohérence du sujet se situent également dans la seconde moitié du panel. Dans Arena text-to-video, CogVideoX-5B occupe le milieu du classement, derrière gemini-omni-flash, Dreamina Seedance 2.0 720p et muse-video. Le premier est nettement devant dans les préférences humaines. Usages pertinents : prototypage vidéo, prévisualisation de campagnes et maquettes de production ; pour un résultat plus abouti, on lui préférera gemini-omni-flash, Dreamina Seedance 2.0 720p ou muse-video.


Sources des données : LLM-Stats (llm-stats.com) · Artificial Analysis (artificialanalysis.ai).