GLM-4.5-Air

GLM-4.5-Air est un LLM à poids ouverts lancé par Zhipu AI le 28 juillet 2025. Cette déclinaison compacte de la série GLM-4.5 compte 106 milliards de paramètres, dont 12 milliards actifs, et propose une fenêtre de contexte de 131 072 tokens.

GLM-4.5-Air est un LLM à poids ouverts lancé par Zhipu AI le 28 juillet 2025. Cette déclinaison compacte de la série GLM-4.5 compte 106 milliards de paramètres, dont 12 milliards actifs, et propose une fenêtre de contexte de 131 072 tokens.

Conçu pour le raisonnement, le codage et les agents intelligents, il combine un mode thinking destiné aux tâches complexes et à l’usage d’outils avec un mode non-thinking pour les réponses directes. Sa licence MIT autorise l’usage commercial et les développements dérivés. Son positionnement très économique constitue un autre trait distinctif.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurZhipu AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie28 juillet 2025
Multimodalnon
Paramètres106 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MATH-50098,1 %4ᵉ / 31llm-statsAuto-déclaré
AIME 202489,4 %10ᵉ / 52llm-statsAuto-déclaré
MMLU-Pro81,4 %42ᵉ / 125llm-statsAuto-déclaré
TAU-bench Retail77,9 %7ᵉ / 24llm-statsAuto-déclaré
BFCL-v376,4 %2ᵉ / 19llm-statsAuto-déclaré
GPQA75,0 %98ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench70,7 %21ᵉ / 72llm-statsAuto-déclaré
AA-Index64,8 %2ᵉ / 3llm-statsAuto-déclaré
TAU-bench Airline60,8 %2ᵉ / 22llm-statsAuto-déclaré
SWE-Bench Verified57,6 %80ᵉ / 102llm-statsAuto-déclaré
SciCode37,3 %16ᵉ / 18llm-statsAuto-déclaré
Terminal-Bench30,0 %20ᵉ / 25llm-statsAuto-déclaré
BrowseComp21,3 %56ᵉ / 57llm-statsAuto-déclaré
Humanity's Last Exam10,6 %79ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
157ᵉgemini-2.5-flash-lite-preview-06-17-thinking1374
158ᵉqwen2.5-max1374
159ᵉGLM-4.5-Air1373
160ᵉClaude 3.5 Sonnet1373
161ᵉClaude 3.7 Sonnet1371

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,13 $0,85 $0,025 $

Prix en dollars US par million de tokens.

Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,08 $
Latence moyenne par benchmark — Benchable48 min 56 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. GLM-4.5-Air obtient ses résultats Baseline les plus solides en connaissances générales et en raisonnement, deux domaines où il se place dans la partie supérieure des classements fournis. À sa sortie, son résultat sur GPQA le situait dans le top 24% des LLM de sa génération, ce qui confirme un positionnement compétitif pour les tâches de raisonnement exigeantes. Sa tarification se trouve 93% sous la moyenne des LLM similaires et environ 42.3 fois sous celle des modèles frontière. La combinaison d’une longue fenêtre de contexte, de deux modes de raisonnement et de poids sous licence MIT renforce son intérêt pour les systèmes agentiques à coût maîtrisé.

Limites et points d'attention. Le codage constitue une faiblesse nette, avec un classement dans la partie basse du benchmark correspondant. Le classement Arena text est également faible, au 157e rang sur 200, loin du modèle en tête. Le résultat relatif sur les hallucinations reste peu favorable malgré un score Baseline élevé, tandis que les mathématiques se situent davantage en milieu de tableau. Ses connaissances s’arrêtent au 31 décembre 2024 et ses 106 milliards de paramètres totaux restent substantiels. GLM-4.5-Air cible surtout les agents, le raisonnement hybride et les usages sensibles au coût nécessitant des poids ouverts.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).