Grok-4.20 Beta

Grok-4.20 Beta est un LLM propriétaire de xAI, sorti le 12 mars 2026. Ses poids ne sont pas ouverts. Son principal signe distinctif est une fenêtre de contexte de 2 000 000 tokens, une capacité destinée au traitement d’entrées particulièrement volumineuses.

Grok-4.20 Beta est un LLM propriétaire de xAI, sorti le 12 mars 2026. Ses poids ne sont pas ouverts. Son principal signe distinctif est une fenêtre de contexte de 2 000 000 tokens, une capacité destinée au traitement d’entrées particulièrement volumineuses.

Le modèle affiche son meilleur positionnement dans l’Arena text, où il se place dans la partie haute du classement sans atteindre la tête. Ses résultats sont nettement moins favorables dans les évaluations consacrées aux documents et au code. Les données disponibles reposent sur trois sources concordantes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie12 mars 2026
Multimodaloui
Fenêtre de contexte2 000 000 tokens (≈ 2,0 M)
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Finance Agent v228,5 %25ᵉ / 26llm-statsn.d.

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text147324ᵉ / 200Claude Fable 5 (1507)
Arena Document141327ᵉ / 32Claude Opus 4.6 (1508)
Arena Code138160ᵉ / 99Kimi K3 (1679)
Arena Vision125328ᵉ / 135Claude Fable 5 (1318)

Notre analyse

Forces. Grok-4.20 Beta obtient son résultat le plus convaincant dans l’Arena text : il figure à proximité du premier quart d’un classement réunissant 200 modèles, avec un écart limité par rapport au modèle en tête. Cette performance indique un positionnement compétitif pour les interactions textuelles générales. Sa fenêtre de contexte de 2 000 000 tokens constitue son autre caractéristique majeure, avec une capacité d’entrée très supérieure à celle nécessaire aux échanges courts.

Limites et points d’attention. Le positionnement se dégrade fortement dans l’Arena document, où Grok-4.20 Beta se situe près du bas d’un classement de 32 modèles. L’Arena code livre un constat intermédiaire mais peu favorable : le modèle apparaît dans la seconde moitié du tableau et reste très éloigné du meilleur score. Son profil est donc déséquilibré, plus solide en texte général qu’en traitement documentaire évalué par l’Arena ou en programmation. Sa licence propriétaire exclut l’accès aux poids. Il convient surtout aux usages textuels nécessitant une très grande fenêtre de contexte, plutôt qu’aux tâches centrées sur le code ou les performances documentaires comparées.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).