GLM-4.5
Publié le 28 juillet 2025 par le chinois Zhipu AI, GLM-4.5 est un LLM fondation de 355 milliards de paramètres, dont 32 milliards actifs. Conçu pour les agents intelligents, il réunit raisonnement, codage et appel d’outils, avec un mode thinking pour les tâches complexes et un mode…
Publié le 28 juillet 2025 par le chinois Zhipu AI, GLM-4.5 est un LLM fondation de 355 milliards de paramètres, dont 32 milliards actifs. Conçu pour les agents intelligents, il réunit raisonnement, codage et appel d’outils, avec un mode thinking pour les tâches complexes et un mode non-thinking pour les réponses immédiates.
Ses poids ouverts sous licence MIT autorisent l’usage commercial. Son tarif, inférieur de 70% à la moyenne des LLM similaires, le place parmi les offres très économiques. Son entraînement représente 4,4 × 10²⁴ FLOP, soit environ 1,2 million d’heures-GPU H100.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 28 juillet 2025 |
| Multimodal | non |
| Paramètres | 355 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 98,2 % | 3ᵉ / 31 | llm-stats | Auto-déclaré |
| AIME 2024 | 91,0 % | 8ᵉ / 52 | llm-stats | Auto-déclaré |
| MMLU-Pro | 84,6 % | 23ᵉ / 125 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 79,7 % | 6ᵉ / 24 | llm-stats | Auto-déclaré |
| GPQA | 79,1 % | 82ᵉ / 219 | llm-stats | Auto-déclaré |
| BFCL-v3 | 77,8 % | 1ᵉ / 19 | llm-stats | Auto-déclaré |
| LiveCodeBench | 72,9 % | 18ᵉ / 72 | llm-stats | Auto-déclaré |
| AA-Index | 67,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 64,2 % | 73ᵉ / 102 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 60,4 % | 3ᵉ / 22 | llm-stats | Auto-déclaré |
| SciCode | 41,7 % | 11ᵉ / 18 | llm-stats | Auto-déclaré |
| Terminal-Bench | 37,5 % | 12ᵉ / 25 | llm-stats | Auto-déclaré |
| BrowseComp | 26,4 % | 55ᵉ / 57 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 14,4 % | 71ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 114ᵉ | Claude Haiku 4.5 | 1412 |
| 115ᵉ | grok-3-preview-02-24 | 1412 |
| 116ᵉ | GLM-4.5 | 1411 |
| 117ᵉ | Gemini 2.5 Flash | 1410 |
| 118ᵉ | mistral-medium-2508 | 1410 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Z.ai | 0,6 $ | 2,2 $ | 0,11 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 71 % en dessous de la moyenne des LLM similaires, et 9,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,14 $ |
| Latence moyenne par benchmark — Benchable | 42 min 55 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 4,4 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 2,3 × 10¹³ |
| Jeu de données | Unspecified unreleased |
| Pays | China,China |
Notre analyse
Forces. GLM-4.5 domine le benchmark General Knowledge et se place dans le top 10 de cette évaluation. Ses résultats sont également élevés en Mathematics et en Coding, même si leurs classements sont moins exceptionnels. À sa sortie, il figurait dans le top 17% des LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour le raisonnement scientifique. Sa fenêtre de contexte de 131 072 tokens convient aux entrées volumineuses. Les versions base, raisonnement hybride et FP8 sont prises en charge avec transformers, vLLM et SGLang, ainsi qu’avec l’appel d’outils au format OpenAI. Son prix est environ 9,2 fois inférieur à celui des modèles frontière.
Limites et points d’attention. Les scores bruts élevés ne se traduisent pas toujours par de bons rangs relatifs. Ethics se situe dans la seconde moitié du classement, Hallucinations reste en milieu de tableau et Email Classification figure près du bas. L’Arena text place aussi GLM-4.5 au-delà de la centième position sur 200, loin de la tête. Ses connaissances s’arrêtent au 31 décembre 2024. Le modèle cible donc surtout les déploiements économiques, ouverts et orientés raisonnement, code ou agents, lorsque le coût et la possibilité d’exploitation commerciale priment sur le meilleur niveau conversationnel disponible.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).