CogVideoX-5B
CogVideoX-5B est un modèle de génération vidéo de Zhipu AI, évalué en text-to-video. Son positionnement intermédiaire le destine surtout à la création de séquences de travail, à la prévisualisation publicitaire et au prototypage de concepts.
CogVideoX-5B est un modèle de génération vidéo de Zhipu AI, évalué en text-to-video. Son positionnement intermédiaire le destine surtout à la création de séquences de travail, à la prévisualisation publicitaire et au prototypage de concepts.
Sorti le 4 mars 2025, il approche un an d’ancienneté, une durée très longue à l’échelle de l’IA. Il doit être comparé aux modèles de sa période et paraît probablement dépassé par les générations récentes. Les modèles de cet âge sont aussi souvent retirés des catalogues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération de vidéos |
| Éditeur | Zhipu AI |
| Poids | ▫ n.d. |
| Date de sortie | 4 mars 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| VBench: Actions humaines | 99,4 % | 3ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Stabilité temporelle | 98,7 % | 40ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Fluidité du mouvement | 96,9 % | 51ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Cohérence du sujet | 96,2 % | 37ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité visuelle | 82,8 % | 31ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Total | 81,6 % | 31ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Respect du prompt | 77,0 % | 20ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Amplitude du mouvement | 71,0 % | 17ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité d'image | 62,9 % | 44ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité esthétique | 62,0 % | 33ᵉ / 62 | vbench | ✅ Mesuré |
Scores objectifs mesurés par VBench (suite d'évaluation automatique de la génération vidéo), en pourcentage (plus haut = mieux). Le rang situe le modèle parmi les modèles vidéo évalués sur la même dimension.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
VBench: Actions humaines
VBench: Stabilité temporelle
Classements Arena (Elo)
Arena Text-to-Video · 129 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | gemini-omni-flash | 1527 |
| 2ᵉ | Dreamina Seedance 2.0 720p | 1482 |
| 3ᵉ | muse-video | 1459 |
| ⋯ | ⋯ | |
| 126ᵉ | Step-Video-T2V | 948 |
| 127ᵉ | Krea Realtime | 912 |
| 128ᵉ | CogVideoX-5B | 852 |
| 129ᵉ | Pyramid Flow | 813 |
Notre analyse
Forces. Dans VBench, les actions humaines constituent son principal point fort et le placent près de la tête du classement. Ce résultat doit être relativisé, car le benchmark plafonne sur cette dimension et départage mal les modèles. La qualité visuelle et le score total se situent au milieu du tableau. La cohérence du sujet reste correcte, sans distinguer CogVideoX-5B des meilleures solutions.
Limites et points d’attention. La fluidité du mouvement est en retrait du classement VBench malgré un score brut élevé. La stabilité temporelle et la cohérence du sujet se situent également dans la seconde moitié du panel. Dans Arena text-to-video, CogVideoX-5B occupe le milieu du classement, derrière gemini-omni-flash, Dreamina Seedance 2.0 720p et muse-video. Le premier est nettement devant dans les préférences humaines. Usages pertinents : prototypage vidéo, prévisualisation de campagnes et maquettes de production ; pour un résultat plus abouti, on lui préférera gemini-omni-flash, Dreamina Seedance 2.0 720p ou muse-video.
Sources des données : LLM-Stats (llm-stats.com) · Artificial Analysis (artificialanalysis.ai).