GLM-4.5-Air
GLM-4.5-Air est un LLM à poids ouverts lancé par Zhipu AI le 28 juillet 2025. Cette déclinaison compacte de la série GLM-4.5 compte 106 milliards de paramètres, dont 12 milliards actifs, et propose une fenêtre de contexte de 131 072 tokens.
GLM-4.5-Air est un LLM à poids ouverts lancé par Zhipu AI le 28 juillet 2025. Cette déclinaison compacte de la série GLM-4.5 compte 106 milliards de paramètres, dont 12 milliards actifs, et propose une fenêtre de contexte de 131 072 tokens.
Conçu pour le raisonnement, le codage et les agents intelligents, il combine un mode thinking destiné aux tâches complexes et à l’usage d’outils avec un mode non-thinking pour les réponses directes. Sa licence MIT autorise l’usage commercial et les développements dérivés. Son positionnement très économique constitue un autre trait distinctif.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Zhipu AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 28 juillet 2025 |
| Multimodal | non |
| Paramètres | 106 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MATH-500 | 98,1 % | 4ᵉ / 31 | llm-stats | Auto-déclaré |
| AIME 2024 | 89,4 % | 10ᵉ / 52 | llm-stats | Auto-déclaré |
| MMLU-Pro | 81,4 % | 42ᵉ / 125 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 77,9 % | 7ᵉ / 24 | llm-stats | Auto-déclaré |
| BFCL-v3 | 76,4 % | 2ᵉ / 19 | llm-stats | Auto-déclaré |
| GPQA | 75,0 % | 98ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 70,7 % | 21ᵉ / 72 | llm-stats | Auto-déclaré |
| AA-Index | 64,8 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 60,8 % | 2ᵉ / 22 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 57,6 % | 80ᵉ / 102 | llm-stats | Auto-déclaré |
| SciCode | 37,3 % | 16ᵉ / 18 | llm-stats | Auto-déclaré |
| Terminal-Bench | 30,0 % | 20ᵉ / 25 | llm-stats | Auto-déclaré |
| BrowseComp | 21,3 % | 56ᵉ / 57 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 10,6 % | 79ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 157ᵉ | gemini-2.5-flash-lite-preview-06-17-thinking | 1374 |
| 158ᵉ | qwen2.5-max | 1374 |
| 159ᵉ | GLM-4.5-Air | 1373 |
| 160ᵉ | Claude 3.5 Sonnet | 1373 |
| 161ᵉ | Claude 3.7 Sonnet | 1371 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,13 $ | 0,85 $ | 0,025 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,08 $ |
| Latence moyenne par benchmark — Benchable | 48 min 56 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. GLM-4.5-Air obtient ses résultats Baseline les plus solides en connaissances générales et en raisonnement, deux domaines où il se place dans la partie supérieure des classements fournis. À sa sortie, son résultat sur GPQA le situait dans le top 24% des LLM de sa génération, ce qui confirme un positionnement compétitif pour les tâches de raisonnement exigeantes. Sa tarification se trouve 93% sous la moyenne des LLM similaires et environ 42.3 fois sous celle des modèles frontière. La combinaison d’une longue fenêtre de contexte, de deux modes de raisonnement et de poids sous licence MIT renforce son intérêt pour les systèmes agentiques à coût maîtrisé.
Limites et points d'attention. Le codage constitue une faiblesse nette, avec un classement dans la partie basse du benchmark correspondant. Le classement Arena text est également faible, au 157e rang sur 200, loin du modèle en tête. Le résultat relatif sur les hallucinations reste peu favorable malgré un score Baseline élevé, tandis que les mathématiques se situent davantage en milieu de tableau. Ses connaissances s’arrêtent au 31 décembre 2024 et ses 106 milliards de paramètres totaux restent substantiels. GLM-4.5-Air cible surtout les agents, le raisonnement hybride et les usages sensibles au coût nécessitant des poids ouverts.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).