Grok-4.1

Grok-4.1 est un LLM propriétaire de xAI, éditeur américain, sorti le 17 novembre 2025. Ses poids ne sont pas ouverts. Le modèle se distingue surtout par une fenêtre de contexte de 256 000 tokens et par un positionnement nettement plus favorable en texte qu’en programmation.

Grok-4.1 est un LLM propriétaire de xAI, éditeur américain, sorti le 17 novembre 2025. Ses poids ne sont pas ouverts. Le modèle se distingue surtout par une fenêtre de contexte de 256 000 tokens et par un positionnement nettement plus favorable en texte qu’en programmation.

Les évaluations Arena text le placent dans la partie haute d’un classement de 200 modèles, sans atteindre la première place. À l’inverse, son résultat en Arena Code révèle un écart important entre ses performances textuelles et ses capacités évaluées sur le code.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie17 novembre 2025
Multimodaloui
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Creative Writing v385,4 %6ᵉ / 12llm-statsAuto-déclaré
FigQA34,0 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
31ᵉernie-5.11468
32ᵉGPT-4.51466
33ᵉGrok-4.11466
34ᵉGrok 4.5 (high)1465
35ᵉMiMo-V2.5-Pro1465

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
31ᵉernie-5.11468
32ᵉGPT-4.51466
33ᵉGrok-4.11466
34ᵉGrok 4.5 (high)1465
35ᵉMiMo-V2.5-Pro1465

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
90ᵉGrok 4.1 Fast1234
91ᵉMistral Large 31224
92ᵉGrok-4.11209
93ᵉGemini 2.5 Pro1204
94ᵉDevstral 21200

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysUnited States of America

Notre analyse

Forces. Grok-4.1 obtient ses meilleurs résultats en Arena text. Deux évaluations distinctes le situent dans le premier quart du classement, avec des scores proches, ce qui indique un positionnement textuel relativement stable. Sa fenêtre de contexte de 256 000 tokens constitue également une caractéristique notable pour le traitement de contenus longs. Ces éléments orientent le modèle vers les tâches textuelles nécessitant la prise en compte d’un volume important de contexte.

Limites et points d’attention. Grok-4.1 reste derrière le modèle en tête dans les deux évaluations Arena text. Sa faiblesse la plus nette apparaît en Arena Code : il se classe près du bas d’un panel de 96 modèles et présente un écart marqué avec le leader. Ce résultat invite à ne pas transposer ses performances textuelles aux tâches de programmation. Sa licence propriétaire implique par ailleurs des poids non ouverts. Grok-4.1 convient donc surtout aux usages textuels à long contexte, tandis que le code constitue son principal point de vigilance.


Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.