Grok-4

Grok-4 est un LLM propriétaire de xAI, lancé le 9 juillet 2025 aux États-Unis. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et se situe désormais derrière les modèles frontière plus récents.

Grok-4 est un LLM propriétaire de xAI, lancé le 9 juillet 2025 aux États-Unis. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et se situe désormais derrière les modèles frontière plus récents.

Le modèle rassemble 3 000 milliards de paramètres, une fenêtre de contexte de 256 000 tokens et des connaissances arrêtées au 31 décembre 2024. Son entraînement reste particulièrement marquant : 5,0 × 10²⁶ FLOP, soit environ 64 000 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 387,8 millions de dollars.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie9 juillet 2025
Connaissances jusqu'à2024-12-31
Multimodaloui
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202591,7 %36ᵉ / 108llm-statsAuto-déclaré
HMMT2590,0 %6ᵉ / 25llm-statsAuto-déclaré
GPQA87,5 %34ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench79,0 %13ᵉ / 72llm-statsAuto-déclaré
Humanity's Last Exam40,0 %32ᵉ / 89llm-statsAuto-déclaré
USAMO2537,5 %3ᵉ / 3llm-statsAuto-déclaré
ARC-AGI v215,9 %13ᵉ / 16llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement5,0 × 10²⁶ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 387 842 678 $ (USD 2023)
Nombre de puces200 000
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Grok-4 figurait dans le top 1% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il obtenait également de solides résultats sur OTIS Mock AIME 2024-2025, qui évalue les mathématiques de niveau olympiade au lycée. Ces performances plaçaient alors le modèle dans le haut du panier pour le raisonnement scientifique et mathématique. Sa fenêtre de 256 000 tokens constitue aussi une caractéristique notable pour le traitement de longs contextes.

Limites et points d’attention. Ses résultats sont nettement moins convaincants sur SimpleQA Verified, consacré aux réponses factuelles vérifiables, ainsi que sur les problèmes d’échecs. FrontierMath révèle surtout une forte baisse face aux mathématiques de recherche les plus difficiles, jusqu’à un score de 2% sur Tier 4. Environ un an après sa sortie, ses performances sont aujourd’hui largement dépassées et ce type d’ancienne version est souvent retiré du catalogue de l’éditeur. Grok-4 reste néanmoins représentatif d’un effort d’entraînement exceptionnel, équivalent à environ 138,9 millions d’heures-GPU H100 et estimé à 387,8 millions de dollars.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.