Grok 4.5
Grok 4.5 est un LLM propriétaire de xAI, sorti le 16 juillet 2026. Il se distingue par une fenêtre de contexte de 500 000 tokens et des connaissances arrêtées au 1er février 2026.
Grok 4.5 est un LLM propriétaire de xAI, sorti le 16 juillet 2026. Il se distingue par une fenêtre de contexte de 500 000 tokens et des connaissances arrêtées au 1er février 2026.
Son profil privilégie le raisonnement mathématique, les questions scientifiques avancées et la programmation. Son positionnement économique complète cet ensemble, avec des tarifs inférieurs à ceux des LLM similaires et nettement plus bas que ceux des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 16 juillet 2026 |
| Connaissances jusqu'à | 2026-02-01 |
| Multimodal | oui |
| Fenêtre de contexte | 500 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 97,8 % | 4ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Coding (Baseline) | 96,0 % | 7ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 93,4 % | 4ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| PinchBench : agentique (OpenClaw, 147 tâches) | 75,2 % | 9ᵉ / 19 | pinchbench | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 57,2 % | 7ᵉ / 17 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 53,5 % | 6ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 36,0 % | 8ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 24,4 % | 8ᵉ / 18 | epoch | ✅ Mesuré |
| GPQA | 93,0 % | 9ᵉ / 219 | llm-stats | n.d. |
| Terminal-Bench 2.1 | 83,3 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| Artificial Analysis Coding Agent Index v1.1 | 76,0 % | 3ᵉ / 4 | llm-stats | n.d. |
| SWE-Bench Pro | 64,7 % | 4ᵉ / 41 | llm-stats | Auto-déclaré |
| Artificial Analysis | 54,0 % | 3ᵉ / 5 | llm-stats | n.d. |
| DeepSWE | 53,0 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| GDPval-AA | 51,4 % | 9ᵉ / 39 | llm-stats | n.d. |
| SWE-Marathon | 29,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Reasoning (Baseline)
Epoch: OTIS Mock AIME 2024-2025
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| xAI | 2 $ | 6 $ | 0,5 $ |
| xai | 2 $ | 6 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 24,83 $ |
| Durée d'exécution — PinchBench | 3 h 48 min |
| Indice valeur/coût — PinchBench | 14,82 |
| Coût moyen par benchmark — Benchable | 0,7 $ |
| Latence moyenne par benchmark — Benchable | 23 min 27 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Grok 4.5 se place dans le top 10 sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, ainsi que sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. À sa sortie, son résultat sur GPQA diamond le situait dans le top 9% des LLM de sa génération. Il obtient aussi une place dans le top 10 en programmation sur Benchable, partagée avec cinq autres modèles. Sa fenêtre de 500 000 tokens constitue un autre atout pour traiter des contextes volumineux. Le prix est 4% inférieur à la moyenne des LLM similaires et environ 2,8 fois moins élevé que celui des modèles frontière.
Limites et points d'attention. Le résultat agentique sur PinchBench le place au milieu des 19 modèles évalués, malgré son appartenance au top 10. Les benchmarks Benchable de raisonnement, de programmation et de mathématiques sont plafonnés. Les nombreuses égalités réduisent donc leur capacité à départager Grok 4.5 de ses concurrents. Le modèle est par ailleurs propriétaire. Il cible surtout les usages scientifiques, mathématiques, de programmation et de traitement de longs contextes avec une contrainte budgétaire.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).