CogVideoX-2B
CogVideoX-2B est un modèle de génération vidéo publié par Zhipu AI le 3 mars 2025. Il se positionne comme un outil de création de séquences pour la production audiovisuelle, la publicité et le prototypage de concepts.
CogVideoX-2B est un modèle de génération vidéo publié par Zhipu AI le 3 mars 2025. Il se positionne comme un outil de création de séquences pour la production audiovisuelle, la publicité et le prototypage de concepts.
À environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA vidéo. Ses résultats VBench le placent globalement en milieu de tableau, avec un profil davantage orienté vers la cohérence des séquences que vers une qualité visuelle de premier plan.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle de génération de vidéos |
| Éditeur | Zhipu AI |
| Poids | ▫ n.d. |
| Date de sortie | 3 mars 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| VBench: Stabilité temporelle | 98,9 % | 34ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Actions humaines | 98,0 % | 8ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Fluidité du mouvement | 97,7 % | 45ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Cohérence du sujet | 96,8 % | 28ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité visuelle | 82,2 % | 41ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Total | 80,9 % | 33ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Respect du prompt | 75,8 % | 25ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité d'image | 61,7 % | 50ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Qualité esthétique | 60,8 % | 40ᵉ / 62 | vbench | ✅ Mesuré |
| VBench: Amplitude du mouvement | 59,9 % | 33ᵉ / 62 | vbench | ✅ Mesuré |
Scores objectifs mesurés par VBench (suite d'évaluation automatique de la génération vidéo), en pourcentage (plus haut = mieux). Le rang situe le modèle parmi les modèles vidéo évalués sur la même dimension.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
VBench: Stabilité temporelle
VBench: Actions humaines
Notre analyse
Forces. CogVideoX-2B se distingue surtout sur les actions humaines, une dimension où il figure dans le haut du classement VBench. La cohérence du sujet reste correcte et se situe dans la première moitié du tableau. La stabilité temporelle obtient un score brut très élevé, mais cette épreuve plafonne et départage peu les modèles. Ces résultats indiquent une aptitude à préserver les principaux éléments d’une scène au fil des images.
Limites et points d’attention. La qualité visuelle se place en retrait, ce qui limite l’intérêt du modèle pour des publicités finalisées ou des productions exigeant un rendu soigné. La fluidité du mouvement affiche elle aussi un score brut élevé, mais son rang reste faible dans un benchmark saturé. Le résultat total se situe au milieu du classement VBench. L’ancienneté du modèle renforce le risque d’un décalage face aux générations plus récentes. Usages pertinents : prototypage rapide, prévisualisation de scènes et production de brouillons vidéo avant une finition avec un modèle plus performant.
Sources des données : LLM-Stats (llm-stats.com).