Grok 4.3

Grok 4.3 est un LLM propriétaire de xAI, lancé le 6 mai 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants, tout en conservant un positionnement tarifaire très économique.

Grok 4.3 est un LLM propriétaire de xAI, lancé le 6 mai 2026. Il se distingue par une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de volumes de texte particulièrement importants, tout en conservant un positionnement tarifaire très économique.

À sa sortie, LiveBench le classait dans le top 100% des 22 LLM de sa génération. Son principal avantage concurrentiel réside dans son coût, inférieur de 37% à la moyenne des modèles similaires et environ 4,4 fois plus faible que celui des modèles frontière. Ses résultats sont toutefois contrastés selon les tâches.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie6 mai 2026
Multimodalnon
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index37.631ᵉ / 137
Code Index42.243ᵉ / 74
Agentic Index24.132ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Finance Agent v237,7 %19ᵉ / 26llm-statsn.d.
GDPval-AA36,7 %31ᵉ / 39llm-statsn.d.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Grok 4.337.6
Qwen3.5 397B A17B32.0

Code Index

Qwen3.5 122B A10B43.3
▶ Grok 4.342.2
Nova 2.0 Pro Preview34.0

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text144264ᵉ / 200Claude Fable 5 (1507)
Arena Image-to-Code137127ᵉ / 31Claude Fable 5 (1627)
Arena Code136067ᵉ / 99Kimi K3 (1679)
Arena Vision124732ᵉ / 135Claude Fable 5 (1318)
Arena Search116321ᵉ / 32Claude Opus 4.6 (1255)

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
xAI1,25 $2,5 $0,2 $
xai1,25 $2,5 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 40 % en dessous de la moyenne des LLM similaires, et 4,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)15,45 $
Durée d'exécution — PinchBench3 h 19 min
Indice valeur/coût — PinchBench6,54
Coût moyen par benchmark — Benchable0,38 $
Latence moyenne par benchmark — Benchable28 min 41 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Grok 4.3 obtient les meilleurs résultats sur plusieurs évaluations Benchable, avec une première place en Hallucinations, General Knowledge, Email Classification et Ethics. Il se montre également solide en Coding et en Reasoning, où ses scores atteignent 96%. Son Intelligence Index le situe dans le premier quart du classement, tandis que l’Arena text le place dans le premier tiers des modèles évalués. La fenêtre de 1 000 000 tokens constitue un autre point fort pour les traitements nécessitant un contexte étendu. Ces résultats s’accompagnent d’un tarif très économique, à partir de 1,25 $ par million de tokens en entrée et 2,5 $ en sortie.

Limites et points d'attention. Les performances sont moins convaincantes dès que l’évaluation porte spécifiquement sur le code ou les tâches agentiques. Le Code Index et l’Agentic Index restent en milieu de tableau. Dans les Arenas, Grok 4.3 se classe dans la seconde moitié en code et près du bas du classement en image-to-code, avec un écart marqué face aux modèles en tête. Son intérêt se concentre donc sur les usages sensibles au coût, aux longs contextes, à la classification et aux tâches textuelles générales, plutôt que sur la génération de code avancée ou la conversion d’images en interfaces.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).