Grok-4.1
Grok-4.1 est un LLM propriétaire de xAI, éditeur américain, sorti le 17 novembre 2025. Ses poids ne sont pas ouverts. Le modèle se distingue surtout par une fenêtre de contexte de 256 000 tokens et par un positionnement nettement plus favorable en texte qu’en programmation.
Grok-4.1 est un LLM propriétaire de xAI, éditeur américain, sorti le 17 novembre 2025. Ses poids ne sont pas ouverts. Le modèle se distingue surtout par une fenêtre de contexte de 256 000 tokens et par un positionnement nettement plus favorable en texte qu’en programmation.
Les évaluations Arena text le placent dans la partie haute d’un classement de 200 modèles, sans atteindre la première place. À l’inverse, son résultat en Arena Code révèle un écart important entre ses performances textuelles et ses capacités évaluées sur le code.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 novembre 2025 |
| Multimodal | oui |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Creative Writing v3 | 85,4 % | 6ᵉ / 12 | llm-stats | Auto-déclaré |
| FigQA | 34,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 31ᵉ | ernie-5.1 | 1468 |
| 32ᵉ | GPT-4.5 | 1466 |
| 33ᵉ | Grok-4.1 | 1466 |
| 34ᵉ | Grok 4.5 (high) | 1465 |
| 35ᵉ | MiMo-V2.5-Pro | 1465 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 31ᵉ | ernie-5.1 | 1468 |
| 32ᵉ | GPT-4.5 | 1466 |
| 33ᵉ | Grok-4.1 | 1466 |
| 34ᵉ | Grok 4.5 (high) | 1465 |
| 35ᵉ | MiMo-V2.5-Pro | 1465 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 90ᵉ | Grok 4.1 Fast | 1234 |
| 91ᵉ | Mistral Large 3 | 1224 |
| 92ᵉ | Grok-4.1 | 1209 |
| 93ᵉ | Gemini 2.5 Pro | 1204 |
| 94ᵉ | Devstral 2 | 1200 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | United States of America |
Notre analyse
Forces. Grok-4.1 obtient ses meilleurs résultats en Arena text. Deux évaluations distinctes le situent dans le premier quart du classement, avec des scores proches, ce qui indique un positionnement textuel relativement stable. Sa fenêtre de contexte de 256 000 tokens constitue également une caractéristique notable pour le traitement de contenus longs. Ces éléments orientent le modèle vers les tâches textuelles nécessitant la prise en compte d’un volume important de contexte.
Limites et points d’attention. Grok-4.1 reste derrière le modèle en tête dans les deux évaluations Arena text. Sa faiblesse la plus nette apparaît en Arena Code : il se classe près du bas d’un panel de 96 modèles et présente un écart marqué avec le leader. Ce résultat invite à ne pas transposer ses performances textuelles aux tâches de programmation. Sa licence propriétaire implique par ailleurs des poids non ouverts. Grok-4.1 convient donc surtout aux usages textuels à long contexte, tandis que le code constitue son principal point de vigilance.
Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.