GLM-5.2

GLM-5.2 est un LLM open-weights de Zhipu AI, publié le 16 juin 2026 sous licence MIT avec usage commercial autorisé. Ses 753 milliards de paramètres, dont 40 milliards actifs, s’accompagnent d’une fenêtre de contexte de 1 048 576 tokens, adaptée aux tâches à long horizon.

GLM-5.2 est un LLM open-weights de Zhipu AI, publié le 16 juin 2026 sous licence MIT avec usage commercial autorisé. Ses 753 milliards de paramètres, dont 40 milliards actifs, s’accompagnent d’une fenêtre de contexte de 1 048 576 tokens, adaptée aux tâches à long horizon.

Le modèle combine plusieurs niveaux d’effort de réflexion pour le codage, afin d’arbitrer performance et latence. Son architecture intègre IndexShare, qui mutualise un indexeur toutes les quatre couches d’attention clairsemée, et une couche MTP améliorée pour le décodage spéculatif. Il est accessible par l’API Z.ai ou déployable localement avec plusieurs frameworks.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurZhipu AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie16 juin 2026
Multimodalnon
Paramètres753 milliards
Paramètres actifs40 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index51.17ᵉ / 137
Code Index68.810ᵉ / 74
Agentic Index43.17ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202699,2 %1ᵉ / 17llm-statsAuto-déclaré
HMMT 202594,4 %9ᵉ / 33llm-statsAuto-déclaré
HMMT Feb 2692,5 %6ᵉ / 11llm-statsAuto-déclaré
GPQA91,2 %16ᵉ / 219llm-statsAuto-déclaré
IMO-AnswerBench91,0 %2ᵉ / 19llm-statsAuto-déclaré
Terminal-Bench 2.182,7 %7ᵉ / 13llm-statsAuto-déclaré
MCP Atlas76,8 %9ᵉ / 30llm-statsAuto-déclaré
FrontierSWE74,0 %4ᵉ / 14llm-statsn.d.
Program Bench63,7 %2ᵉ / 5llm-statsAuto-déclaré
SWE-Bench Pro62,1 %10ᵉ / 41llm-statsAuto-déclaré
Humanity's Last Exam54,7 %10ᵉ / 89llm-statsAuto-déclaré
NL2Repo48,9 %1ᵉ / 12llm-statsAuto-déclaré
Toolathlon48,2 %17ᵉ / 30llm-statsAuto-déclaré
DeepSWE46,2 %6ᵉ / 9llm-statsAuto-déclaré
PostTrainBench34,3 %3ᵉ / 5llm-statsAuto-déclaré
CritPT16,7 %1ᵉ / 4llm-statsAuto-déclaré
SWE-Marathon13,0 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GLM-5.251.1

Code Index

▶ GLM-5.268.8

Classements Arena (Elo)

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
4ᵉGLM-5.21587
5ᵉClaude Opus 4.81562
6ᵉGrok 4.5 (high)1558

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
28ᵉGrok-4.20 Multi-Agent Beta1470
29ᵉClaude Opus 4.51469
30ᵉGLM-5.21468
31ᵉernie-5.11468
32ᵉGPT-4.51466

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,2954 $0,9284 $0,05486 $
deepinfra0,95 $3 $n.d.
fireworks1,4 $4,4 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)19,21 $
Durée d'exécution — PinchBench4 h 23 min
Indice valeur/coût — PinchBench4,82
Coût moyen par benchmark — Benchable0,13 $
Latence moyenne par benchmark — Benchable35 min 19 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GLM-5.2 se place dans le top 10 des Intelligence Index, Code Index et Agentic Index. Il atteint la première place du test Hallucinations (Baseline) et se distingue particulièrement en programmation, avec la troisième place de l’Arena Code. Son résultat sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat, le situe près des meilleurs modèles évalués. À sa sortie, il figurait dans le top 13% des LLM de sa génération sur ce benchmark. Son contexte d’environ un million de tokens renforce son positionnement sur les tâches longues. La tarification est très économique, 79% sous la moyenne des LLM similaires et environ 13,1 fois inférieure à celle des modèles frontière. La licence MIT autorise aussi les usages commerciaux et le déploiement local, notamment avec SGLang, vLLM, Transformers, KTransformers, Unsloth et des frameworks compatibles Ascend NPU.

Limites et points d'attention. Les performances sont moins homogènes hors du code. Dans l’Arena text, GLM-5.2 occupe une position nettement plus éloignée de la tête. Les classements Ethics et Email Classification le placent également dans la seconde moitié des modèles évalués, malgré des scores Baseline élevés. Reasoning et Coding affichent le même contraste entre bons scores bruts et rangs plus ordinaires. GLM-5.2 cible donc surtout le développement logiciel, les agents et les traitements à contexte très long, avec un coût particulièrement contenu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).