CogVideoX1.5-5B

CogVideoX1.5-5B est un modèle de génération vidéo de Zhipu AI, sorti le 15 novembre 2024. Il vise la création de séquences pour la production audiovisuelle, la publicité et le prototypage.

CogVideoX1.5-5B est un modèle de génération vidéo de Zhipu AI, sorti le 15 novembre 2024. Il vise la création de séquences pour la production audiovisuelle, la publicité et le prototypage.

Son classement global VBench le place dans la première moitié des modèles évalués. Son ancienneté, proche de deux ans, est toutefois très longue à l’échelle de l’IA générative. Il doit donc être replacé parmi les modèles de sa période et paraît probablement dépassé par des solutions plus récentes.

Caractéristiques

CaractéristiqueValeur
TypeModèle de génération de vidéos
ÉditeurZhipu AI
Poids▫ n.d.
Date de sortie15 novembre 2024

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
VBench: Stabilité temporelle98,5 %46ᵉ / 62vbench✅ Mesuré
VBench: Fluidité du mouvement98,2 %34ᵉ / 62vbench✅ Mesuré
VBench: Actions humaines97,6 %11ᵉ / 62vbench✅ Mesuré
VBench: Cohérence du sujet96,6 %33ᵉ / 62vbench✅ Mesuré
VBench: Qualité visuelle82,7 %32ᵉ / 62vbench✅ Mesuré
VBench: Total82,0 %23ᵉ / 62vbench✅ Mesuré
VBench: Respect du prompt79,2 %12ᵉ / 62vbench✅ Mesuré
VBench: Qualité d'image65,3 %37ᵉ / 62vbench✅ Mesuré
VBench: Qualité esthétique62,1 %31ᵉ / 62vbench✅ Mesuré
VBench: Amplitude du mouvement56,2 %37ᵉ / 62vbench✅ Mesuré

Scores objectifs mesurés par VBench (suite d'évaluation automatique de la génération vidéo), en pourcentage (plus haut = mieux). Le rang situe le modèle parmi les modèles vidéo évalués sur la même dimension.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

VBench: Stabilité temporelle

Pika Beta100 %
IPOW100 %
MAGI-T2V-4.5B-distill100 %
Vchitect-2.099 %
▶ CogVideoX1.5-5B99 %
AnimateLCM99 %

VBench: Fluidité du mouvement

Gen-2100 %
Pika Beta100 %
AnimateLCM98 %
▶ CogVideoX1.5-5B98 %
RepVideo98 %

Notre analyse

Forces. CogVideoX1.5-5B se distingue surtout dans la représentation des actions humaines, une dimension où il se classe près du haut du tableau VBench. La cohérence du sujet obtient un résultat brut élevé, mais le modèle reste au milieu du classement sur ce critère plafonné et peu discriminant. Son classement global demeure honorable, dans la première moitié du panel.

Limites et points d’attention. La qualité visuelle et la fluidité du mouvement se situent au milieu du tableau. La stabilité temporelle affiche également un score brut élevé, mais son rang est nettement en retrait. Ces résultats suggèrent que les pourcentages proches du plafond ne suffisent pas à distinguer le modèle face à ses concurrents. Son âge réduit aussi son intérêt pour une production exigeant un rendu actuel et très abouti. Usages pertinents : prototypage de séquences, prévisualisation d’actions humaines et création publicitaire lorsque la rapidité d’itération prime sur la finition visuelle.


Sources des données : LLM-Stats (llm-stats.com).