GLM-4.7

GLM-4.7 est un LLM de Zhipu AI sorti le 22 décembre 2025. Ce modèle chinois de 358 milliards de paramètres, dont 32 milliards actifs, se distingue par une fenêtre de contexte de 204 800 tokens, une licence MIT autorisant l’usage commercial et un positionnement très économique.

GLM-4.7 est un LLM de Zhipu AI sorti le 22 décembre 2025. Ce modèle chinois de 358 milliards de paramètres, dont 32 milliards actifs, se distingue par une fenêtre de contexte de 204 800 tokens, une licence MIT autorisant l’usage commercial et un positionnement très économique.

Orienté vers le codage agentique multilingue, il couvre les tâches en terminal, la création d’interfaces web et de diapositives, l’usage d’outils et la navigation web. Son entraînement représente 4,4 × 10²⁴ FLOP, soit environ 1,2 million d’heures-GPU H100, l’équivalent de 570 GPU H100 mobilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurZhipu AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie22 décembre 2025
Multimodaloui
Paramètres358 milliards
Paramètres actifs32 milliards
Fenêtre de contexte204 800 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index26.673ᵉ / 137
Code Index45.338ᵉ / 74
Agentic Index25.430ᵉ / 68
Math Index48.033ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202595,7 %19ᵉ / 108llm-statsAuto-déclaré
Tau-bench87,4 %2ᵉ / 6llm-statsAuto-déclaré
GPQA85,7 %42ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench v684,9 %10ᵉ / 53llm-statsAuto-déclaré
MMLU-Pro84,3 %25ᵉ / 125llm-statsAuto-déclaré
IMO-AnswerBench82,0 %12ᵉ / 19llm-statsAuto-déclaré
SWE-Bench Verified73,8 %38ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual66,7 %23ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh66,6 %5ᵉ / 13llm-statsAuto-déclaré
BrowseComp52,0 %39ᵉ / 57llm-statsAuto-déclaré
Humanity's Last Exam42,8 %28ᵉ / 89llm-statsAuto-déclaré
Terminal-Bench 2.041,0 %44ᵉ / 49llm-statsAuto-déclaré
Terminal-Bench33,3 %16ᵉ / 25llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ GLM-4.726.6
Nova 2.0 Pro Preview21.8

Code Index

▶ GLM-4.745.3
Qwen3.5 122B A10B43.3

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
63ᵉChatGPT-4o Latest1443
64ᵉGrok 4.31442
65ᵉGLM-4.71442
66ᵉQwen3.5-397B-A17B1442
67ᵉinkling1441

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
33ᵉDeepSeek V4 Pro1447
34ᵉGemini 3.1 Pro Preview1444
35ᵉGLM-4.71440
36ᵉGemini 3 Pro1439
37ᵉGPT-4.51437

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,4 $1,75 $0,08 $

Prix en dollars US par million de tokens.

Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,23 $
Latence moyenne par benchmark — Benchable1 h 05 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement4,4 × 10²⁴ FLOP
PaysChina

Notre analyse

Forces. À sa sortie, GLM-4.7 figurait dans le top 16% des LLM de sa génération sur GPQA diamond. Son Code Index et son Agentic Index le placent dans la première moitié des modèles évalués, ce qui concorde avec son orientation vers le code, les outils et les tâches en terminal. Il obtient aussi un résultat parfait et la première place sur Ethics (Baseline), tandis que ses scores Baseline en connaissances générales, classification d’e-mails, mathématiques, raisonnement et codage restent élevés. Ses modes Interleaved Thinking, Preserved Thinking et Turn-level Thinking gèrent le raisonnement par tour et sa conservation dans les échanges multi-tours. Le déploiement local est pris en charge avec transformers, vLLM et SGLang, en complément de l’API Z.ai.

Limites et points d'attention. Les classements nuancent les pourcentages Baseline élevés : GLM-4.7 reste en milieu de tableau sur l’Intelligence Index, le Math Index, Arena text et plusieurs évaluations généralistes. Arena code confirme un niveau compétitif sans le rapprocher de la tête du classement. Son principal avantage concurrentiel est économique : sa tarification se situe 80% sous la moyenne des LLM similaires et environ 13,8 fois sous celle des modèles frontière. GLM-4.7 cible ainsi le codage assisté, les agents utilisant des outils et les déploiements locaux sensibles au coût.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).