GLM-4.5V

GLM-4.5V est un modèle vision-langage open weights de Zhipu AI, publié le 11 août 2025 sous licence MIT avec usage commercial autorisé. Il traite le texte, les images, la vidéo et les documents, et peut piloter des interfaces graphiques en localisant des éléments par boîtes englobantes…

GLM-4.5V est un modèle vision-langage open weights de Zhipu AI, publié le 11 août 2025 sous licence MIT avec usage commercial autorisé. Il traite le texte, les images, la vidéo et les documents, et peut piloter des interfaces graphiques en localisant des éléments par boîtes englobantes normalisées.

Référencé à 108 milliards de paramètres, il repose sur GLM-4.5-Air et intègre une architecture annoncée à 106 milliards de paramètres, dont 12 milliards actifs. Son mode Thinking alterne réponses rapides et raisonnement approfondi. Sa fenêtre de 131 072 tokens et son tarif très économique structurent son positionnement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurZhipu AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie11 août 2025
Multimodaloui
Paramètres108 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text,image → text

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
175ᵉPrime Intellect: INTELLECT-31356
176ᵉCommand A+1354
177ᵉGLM-4.5V1354
178ᵉgemini-2.0-flash-lite-preview-02-051353
179ᵉGPT OSS 120B1353

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
83ᵉmistral-medium-25081158
84ᵉstep-1o-turbo-2025061157
85ᵉGLM-4.5V1156
86ᵉmistral-medium-25051156
87ᵉhunyuan-large-vision1149

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,6 $1,8 $0,11 $

Prix en dollars US par million de tokens.

Sa tarification se situe 71 % en dessous de la moyenne des LLM similaires, et 9,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,09 $
Latence moyenne par benchmark — Benchable10 min 38 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GLM-4.5V obtient ses résultats les plus solides en General Knowledge, Email Classification et Ethics, avec des scores Baseline très élevés. Email Classification constitue son meilleur classement relatif, dans le premier dixième des modèles évalués. Coding et Reasoning affichent également de bons scores absolus, même si leur classement est moins favorable. Sa polyvalence couvre l’analyse d’images, de vidéos et de documents, le grounding visuel et les opérations d’agent GUI. L’exploitation passe par Transformers, vLLM, SGLang, une API ou une application desktop, tandis que LLaMA-Factory prend en charge le fine-tuning. Son prix se situe 70% sous la moyenne des LLM similaires et environ 9,2 fois sous celui des modèles frontière.

Limites et points d'attention. Les classements nuancent les scores Baseline élevés. GLM-4.5V reste en milieu de tableau pour General Knowledge, Ethics, Hallucinations, Coding et Reasoning. Son résultat Hallucinations ne le place notamment que dans la partie basse du classement associé. Les évaluations Arena sont plus sévères encore, avec une position proche du bas du tableau en texte et dans le dernier tiers en vision, loin du modèle de tête dans les deux catégories. Ses connaissances s’arrêtent au 31 décembre 2024. GLM-4.5V cible ainsi les usages multimodaux, documentaires et d’automatisation d’interfaces qui privilégient une longue fenêtre de contexte, des poids ouverts et un coût réduit.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).