Z.ai: GLM 4.6V

Publié le 8 décembre 2025 par Zhipu AI, Z.ai: GLM 4.6V est un LLM multimodal de 106 milliards de paramètres destiné aux environnements cloud et aux clusters haute performance. Sa fenêtre de contexte atteint 131 072 tokens, soit le format 128k annoncé pour cette version.

Publié le 8 décembre 2025 par Zhipu AI, Z.ai: GLM 4.6V est un LLM multimodal de 106 milliards de paramètres destiné aux environnements cloud et aux clusters haute performance. Sa fenêtre de contexte atteint 131 072 tokens, soit le format 128k annoncé pour cette version.

Le modèle traite des images, des captures d’écran et des pages de documents, y compris comme entrées directes d’outils via le function calling multimodal. Il se distingue surtout par un tarif très économique, inférieur de 85 % à la moyenne des LLM similaires, tout en couvrant des usages mêlant texte, vision, documents et interfaces.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurZhipu AI
Poids🟢 Poids ouverts
Date de sortie8 décembre 2025
Multimodaloui
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)image,text,video → text

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
153ᵉGemini 2.5 Flash Lite Preview1380
154ᵉArcee AI: Trinity Large Preview1379
155ᵉZ.ai: GLM 4.6V1377
156ᵉQwen3 235B A22B1375
157ᵉgemini-2.5-flash-lite-preview-06-17-thinking1374

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
76ᵉGemini 2.5 Flash Lite Preview1174
77ᵉgemini-2.0-flash-0011172
78ᵉZ.ai: GLM 4.6V1164
79ᵉGPT-4o1162
80ᵉClaude 3.5 Sonnet1160

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,3 $0,9 $0,055 $

Prix en dollars US par million de tokens.

Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. GLM 4.6V combine une longue fenêtre de contexte avec plusieurs fonctions multimodales concrètes : compréhension de documents longs ou multiples, génération entrelacée d’images et de texte, reproduction d’interfaces frontend et édition visuelle à partir de captures d’écran. Son function calling multimodal peut transmettre directement des images, des pages de documents ou des captures à des outils. Son principal avantage compétitif reste le coût : l’entrée commence à 0,3 $ par million de tokens et la sortie à 0,9 $, soit environ 18,3 fois moins que les modèles frontière. Ce positionnement repose sur trois sources de données concordantes.

Limites et points d'attention. Les résultats Arena placent le modèle loin des premières positions. En texte, il se situe dans le dernier quart du classement, avec un écart net face au modèle de tête. En vision, son classement reste également dans la moitié inférieure. Ces résultats indiquent que son prix très bas ne s’accompagne pas d’un niveau de préférence comparable à celui des modèles haut de gamme évalués dans les mêmes arènes. GLM 4.6V cible donc surtout les traitements multimodaux à grand volume, les documents, les captures d’écran et les interfaces lorsque le coût compte davantage qu’un classement de premier plan.


Sources des données : OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com).