GLM-4.7
GLM-4.7 est un LLM de Zhipu AI sorti le 22 décembre 2025. Ce modèle chinois de 358 milliards de paramètres, dont 32 milliards actifs, se distingue par une fenêtre de contexte de 204 800 tokens, une licence MIT autorisant l’usage commercial et un positionnement très économique.
GLM-4.7 est un LLM de Zhipu AI sorti le 22 décembre 2025. Ce modèle chinois de 358 milliards de paramètres, dont 32 milliards actifs, se distingue par une fenêtre de contexte de 204 800 tokens, une licence MIT autorisant l’usage commercial et un positionnement très économique.
Orienté vers le codage agentique multilingue, il couvre les tâches en terminal, la création d’interfaces web et de diapositives, l’usage d’outils et la navigation web. Son entraînement représente 4,4 × 10²⁴ FLOP, soit environ 1,2 million d’heures-GPU H100, l’équivalent de 570 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 22 décembre 2025 |
| Multimodal | oui |
| Paramètres | 358 milliards |
| Paramètres actifs | 32 milliards |
| Fenêtre de contexte | 204 800 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 26.6 | 73ᵉ / 137 |
| Code Index | 45.3 | 38ᵉ / 74 |
| Agentic Index | 25.4 | 30ᵉ / 68 |
| Math Index | 48.0 | 33ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 95,7 % | 19ᵉ / 108 | llm-stats | Auto-déclaré |
| Tau-bench | 87,4 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
| GPQA | 85,7 % | 42ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 84,9 % | 10ᵉ / 53 | llm-stats | Auto-déclaré |
| MMLU-Pro | 84,3 % | 25ᵉ / 125 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 82,0 % | 12ᵉ / 19 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,8 % | 38ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 66,7 % | 23ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 66,6 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 52,0 % | 39ᵉ / 57 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 42,8 % | 28ᵉ / 89 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 41,0 % | 44ᵉ / 49 | llm-stats | Auto-déclaré |
| Terminal-Bench | 33,3 % | 16ᵉ / 25 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 63ᵉ | ChatGPT-4o Latest | 1443 |
| 64ᵉ | Grok 4.3 | 1442 |
| 65ᵉ | GLM-4.7 | 1442 |
| 66ᵉ | Qwen3.5-397B-A17B | 1442 |
| 67ᵉ | inkling | 1441 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 33ᵉ | DeepSeek V4 Pro | 1447 |
| 34ᵉ | Gemini 3.1 Pro Preview | 1444 |
| 35ᵉ | GLM-4.7 | 1440 |
| 36ᵉ | Gemini 3 Pro | 1439 |
| 37ᵉ | GPT-4.5 | 1437 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,4 $ | 1,75 $ | 0,08 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,23 $ |
| Latence moyenne par benchmark — Benchable | 1 h 05 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,4 × 10²⁴ FLOP |
| Pays | China |
Notre analyse
Forces. À sa sortie, GLM-4.7 figurait dans le top 16% des LLM de sa génération sur GPQA diamond. Son Code Index et son Agentic Index le placent dans la première moitié des modèles évalués, ce qui concorde avec son orientation vers le code, les outils et les tâches en terminal. Il obtient aussi un résultat parfait et la première place sur Ethics (Baseline), tandis que ses scores Baseline en connaissances générales, classification d’e-mails, mathématiques, raisonnement et codage restent élevés. Ses modes Interleaved Thinking, Preserved Thinking et Turn-level Thinking gèrent le raisonnement par tour et sa conservation dans les échanges multi-tours. Le déploiement local est pris en charge avec transformers, vLLM et SGLang, en complément de l’API Z.ai.
Limites et points d'attention. Les classements nuancent les pourcentages Baseline élevés : GLM-4.7 reste en milieu de tableau sur l’Intelligence Index, le Math Index, Arena text et plusieurs évaluations généralistes. Arena code confirme un niveau compétitif sans le rapprocher de la tête du classement. Son principal avantage concurrentiel est économique : sa tarification se situe 80% sous la moyenne des LLM similaires et environ 13,8 fois sous celle des modèles frontière. GLM-4.7 cible ainsi le codage assisté, les agents utilisant des outils et les déploiements locaux sensibles au coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).