Grok 4.5

Grok 4.5 est un LLM propriétaire de xAI, sorti le 16 juillet 2026. Il se distingue par une fenêtre de contexte de 500 000 tokens et des connaissances arrêtées au 1er février 2026.

Grok 4.5 est un LLM propriétaire de xAI, sorti le 16 juillet 2026. Il se distingue par une fenêtre de contexte de 500 000 tokens et des connaissances arrêtées au 1er février 2026.

Son profil privilégie le raisonnement mathématique, les questions scientifiques avancées et la programmation. Son positionnement économique complète cet ensemble, avec des tarifs inférieurs à ceux des LLM similaires et nettement plus bas que ceux des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie16 juillet 2026
Connaissances jusqu'à2026-02-01
Multimodaloui
Fenêtre de contexte500 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202597,8 %4ᵉ / 64epoch✅ Mesuré
Benchable : Coding (Baseline)96,0 %7ᵉ / 162benchable✅ Mesuré
Epoch: GPQA diamond93,4 %4ᵉ / 85epoch✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)75,2 %9ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private57,2 %7ᵉ / 17epoch✅ Mesuré
Epoch: SimpleQA Verified53,5 %6ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles36,0 %8ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private24,4 %8ᵉ / 18epoch✅ Mesuré
GPQA93,0 %9ᵉ / 219llm-statsn.d.
Terminal-Bench 2.183,3 %6ᵉ / 13llm-statsAuto-déclaré
Artificial Analysis Coding Agent Index v1.176,0 %3ᵉ / 4llm-statsn.d.
SWE-Bench Pro64,7 %4ᵉ / 41llm-statsAuto-déclaré
Artificial Analysis54,0 %3ᵉ / 5llm-statsn.d.
DeepSWE53,0 %5ᵉ / 9llm-statsAuto-déclaré
GDPval-AA51,4 %9ᵉ / 39llm-statsn.d.
SWE-Marathon29,0 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Reasoning (Baseline)

▶ Grok 4.5100 %

Epoch: OTIS Mock AIME 2024-2025

▶ Grok 4.598 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
xAI2 $6 $0,5 $
xai2 $6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)24,83 $
Durée d'exécution — PinchBench3 h 48 min
Indice valeur/coût — PinchBench14,82
Coût moyen par benchmark — Benchable0,7 $
Latence moyenne par benchmark — Benchable23 min 27 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Grok 4.5 se place dans le top 10 sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, ainsi que sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. À sa sortie, son résultat sur GPQA diamond le situait dans le top 9% des LLM de sa génération. Il obtient aussi une place dans le top 10 en programmation sur Benchable, partagée avec cinq autres modèles. Sa fenêtre de 500 000 tokens constitue un autre atout pour traiter des contextes volumineux. Le prix est 4% inférieur à la moyenne des LLM similaires et environ 2,8 fois moins élevé que celui des modèles frontière.

Limites et points d'attention. Le résultat agentique sur PinchBench le place au milieu des 19 modèles évalués, malgré son appartenance au top 10. Les benchmarks Benchable de raisonnement, de programmation et de mathématiques sont plafonnés. Les nombreuses égalités réduisent donc leur capacité à départager Grok 4.5 de ses concurrents. Le modèle est par ailleurs propriétaire. Il cible surtout les usages scientifiques, mathématiques, de programmation et de traitement de longs contextes avec une contrainte budgétaire.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).