GLM-4.5V
GLM-4.5V est un modèle vision-langage open weights de Zhipu AI, publié le 11 août 2025 sous licence MIT avec usage commercial autorisé. Il traite le texte, les images, la vidéo et les documents, et peut piloter des interfaces graphiques en localisant des éléments par boîtes englobantes…
GLM-4.5V est un modèle vision-langage open weights de Zhipu AI, publié le 11 août 2025 sous licence MIT avec usage commercial autorisé. Il traite le texte, les images, la vidéo et les documents, et peut piloter des interfaces graphiques en localisant des éléments par boîtes englobantes normalisées.
Référencé à 108 milliards de paramètres, il repose sur GLM-4.5-Air et intègre une architecture annoncée à 106 milliards de paramètres, dont 12 milliards actifs. Son mode Thinking alterne réponses rapides et raisonnement approfondi. Sa fenêtre de 131 072 tokens et son tarif très économique structurent son positionnement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 11 août 2025 |
| Multimodal | oui |
| Paramètres | 108 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text,image → text |
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 175ᵉ | Prime Intellect: INTELLECT-3 | 1356 |
| 176ᵉ | Command A+ | 1354 |
| 177ᵉ | GLM-4.5V | 1354 |
| 178ᵉ | gemini-2.0-flash-lite-preview-02-05 | 1353 |
| 179ᵉ | GPT OSS 120B | 1353 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 83ᵉ | mistral-medium-2508 | 1158 |
| 84ᵉ | step-1o-turbo-202506 | 1157 |
| 85ᵉ | GLM-4.5V | 1156 |
| 86ᵉ | mistral-medium-2505 | 1156 |
| 87ᵉ | hunyuan-large-vision | 1149 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,6 $ | 1,8 $ | 0,11 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 71 % en dessous de la moyenne des LLM similaires, et 9,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,09 $ |
| Latence moyenne par benchmark — Benchable | 10 min 38 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GLM-4.5V obtient ses résultats les plus solides en General Knowledge, Email Classification et Ethics, avec des scores Baseline très élevés. Email Classification constitue son meilleur classement relatif, dans le premier dixième des modèles évalués. Coding et Reasoning affichent également de bons scores absolus, même si leur classement est moins favorable. Sa polyvalence couvre l’analyse d’images, de vidéos et de documents, le grounding visuel et les opérations d’agent GUI. L’exploitation passe par Transformers, vLLM, SGLang, une API ou une application desktop, tandis que LLaMA-Factory prend en charge le fine-tuning. Son prix se situe 70% sous la moyenne des LLM similaires et environ 9,2 fois sous celui des modèles frontière.
Limites et points d'attention. Les classements nuancent les scores Baseline élevés. GLM-4.5V reste en milieu de tableau pour General Knowledge, Ethics, Hallucinations, Coding et Reasoning. Son résultat Hallucinations ne le place notamment que dans la partie basse du classement associé. Les évaluations Arena sont plus sévères encore, avec une position proche du bas du tableau en texte et dans le dernier tiers en vision, loin du modèle de tête dans les deux catégories. Ses connaissances s’arrêtent au 31 décembre 2024. GLM-4.5V cible ainsi les usages multimodaux, documentaires et d’automatisation d’interfaces qui privilégient une longue fenêtre de contexte, des poids ouverts et un coût réduit.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).