Grok 4.20

Grok 4.20 est un LLM de xAI sorti le 31 mars 2026 aux États-Unis. Il se distingue par 500 milliards de paramètres et une fenêtre de contexte de 2 millions de tokens, adaptée au traitement de volumes de texte particulièrement longs.

Grok 4.20 est un LLM de xAI sorti le 31 mars 2026 aux États-Unis. Il se distingue par 500 milliards de paramètres et une fenêtre de contexte de 2 millions de tokens, adaptée au traitement de volumes de texte particulièrement longs.

Son positionnement est très économique : sa tarification se situe 37 % sous la moyenne des LLM similaires et environ 4,4 fois sous celle des modèles frontière. Ses connaissances couvrent les informations disponibles jusqu’au 1er septembre 2025.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids▫ n.d.
Date de sortie31 mars 2026
Connaissances jusqu'à2025-09-01
Multimodaloui
Paramètres500 milliards
Fenêtre de contexte2 000 000 tokens (≈ 2,0 M)
Modalités (entrée → sortie)text,image,file → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index21.894ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: OTIS Mock AIME 2024-202592,2 %9ᵉ / 64epoch✅ Mesuré
Epoch: GPQA diamond89,3 %9ᵉ / 85epoch✅ Mesuré
PinchBench : agentique (OpenClaw, 147 tâches)80,3 %7ᵉ / 19pinchbench✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private44,9 %12ᵉ / 17epoch✅ Mesuré
Epoch: SimpleQA Verified35,1 %16ᵉ / 26epoch✅ Mesuré
Epoch: Chess Puzzles24,0 %11ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private17,1 %11ᵉ / 18epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Grok 4.2021.8
Nova 2.0 Pro Preview21.8

Epoch: OTIS Mock AIME 2024-2025

▶ Grok 4.2092 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
xAI1,25 $2,5 $0,2 $

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)22,47 $
Durée d'exécution — PinchBench3 h 25 min
Indice valeur/coût — PinchBench5,26

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysUnited States of America

Notre analyse

Forces. Grok 4.20 obtient son résultat le plus convaincant sur PinchBench, qui évalue les capacités agentiques avec OpenClaw sur 147 tâches. Son classement le place parmi les modèles les plus performants de ce benchmark. Sa fenêtre de 2 millions de tokens constitue un autre atout concret pour analyser de très longs contenus dans un même contexte. Le rapport entre capacité de contexte et prix est favorable : les tarifs d’entrée et de sortie restent nettement inférieurs à ceux des LLM comparables et des modèles frontière.

Limites et points d’attention. L’Intelligence Index situe Grok 4.20 dans le tiers inférieur du classement évalué, malgré ses 500 milliards de paramètres. Ses performances agentiques ne se traduisent donc pas par un niveau général équivalent face à l’ensemble des modèles testés. La limite de connaissances fixée au 1er septembre 2025 exclut aussi les événements ultérieurs. Grok 4.20 convient surtout aux traitements agentiques et aux analyses de très longs contextes lorsque le coût constitue un critère central.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).