GLM-4.6
Sorti le 30 septembre 2025, GLM-4.6 est un LLM de 357 milliards de paramètres développé en Chine par Zhipu AI. Ses poids ouverts sous licence MIT autorisent l’usage commercial. Le modèle associe une fenêtre de contexte de 202 752 tokens à un positionnement tarifaire très économique.
Sorti le 30 septembre 2025, GLM-4.6 est un LLM de 357 milliards de paramètres développé en Chine par Zhipu AI. Ses poids ouverts sous licence MIT autorisent l’usage commercial. Le modèle associe une fenêtre de contexte de 202 752 tokens à un positionnement tarifaire très économique.
Cette évolution de GLM-4.5 cible le codage, la création de pages front-end soignées, le raisonnement avec outils, les agents de recherche et l’écriture stylistiquement contrôlée. Son entraînement représente 4,4 × 10²⁴ FLOP, soit environ 1,2 million d’heures-GPU H100, l’équivalent de 570 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 30 septembre 2025 |
| Multimodal | oui |
| Paramètres | 357 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 93,9 % | 24ᵉ / 108 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 82,8 % | 14ᵉ / 53 | llm-stats | Auto-déclaré |
| GPQA | 81,0 % | 73ᵉ / 219 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 68,0 % | 65ᵉ / 102 | llm-stats | Auto-déclaré |
| BrowseComp | 45,1 % | 46ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench | 40,5 % | 8ᵉ / 25 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 17,2 % | 62ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 86ᵉ | amazon-nova-experimental-chat-26-02-10 | 1427 |
| 87ᵉ | gpt-5-chat-2025-08-07 | 1427 |
| 88ᵉ | GLM-4.6 | 1425 |
| 89ᵉ | DeepSeek-V3.2 | 1425 |
| 90ᵉ | deepseek-v3.2-exp-thinking | 1425 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 67ᵉ | Grok 4.3 | 1360 |
| 68ᵉ | Qwen3.5-27B | 1356 |
| 69ᵉ | GLM-4.6 | 1355 |
| 70ᵉ | laguna-m.1 | 1355 |
| 71ᵉ | GPT-5.1 | 1340 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Venice | 0,43 $ | 1,75 $ | 0,08 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 79 % en dessous de la moyenne des LLM similaires, et 12,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 12 min 04 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,4 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 2,3 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Durée d'entraînement | 2 880 h |
| Pays | China,China |
Notre analyse
Forces. GLM-4.6 se distingue particulièrement en classification d’e-mails et en éthique, deux évaluations où il atteint le top 10. Les résultats sont également solides en mathématiques, puis en raisonnement. À sa sortie, son classement dans le top 14% des LLM de sa génération sur GPQA le plaçait dans le haut du panier sur cette évaluation. Sa longue fenêtre de contexte soutient le traitement de contenus volumineux, tandis que ses fonctions couvrent la génération de code, les interfaces front-end, l’usage d’outils pendant l’inférence et les agents combinant outils et recherche. Son prix constitue un autre avantage net : il se situe 78% sous la moyenne des LLM similaires et environ 12,8 fois sous celui des modèles frontière.
Limites et points d’attention. Les classements Arena nuancent les scores ciblés : GLM-4.6 reste en milieu de tableau en texte et dans la partie basse en code, avec un écart marqué face aux modèles en tête. Le benchmark Hallucinations constitue son point faible relatif, son classement étant nettement inférieur à ceux obtenus en mathématiques, en classification d’e-mails ou en éthique. Son score maximal en General Knowledge ne se traduit pas non plus par une place dominante, de nombreux modèles obtenant un résultat comparable. GLM-4.6 convient surtout aux usages sensibles au coût, aux longs contextes, au codage assisté et aux workflows utilisant des outils.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).