Grok-4
Grok-4 est un LLM propriétaire de xAI, lancé le 9 juillet 2025 aux États-Unis. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et se situe désormais derrière les modèles frontière plus récents.
Grok-4 est un LLM propriétaire de xAI, lancé le 9 juillet 2025 aux États-Unis. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et se situe désormais derrière les modèles frontière plus récents.
Le modèle rassemble 3 000 milliards de paramètres, une fenêtre de contexte de 256 000 tokens et des connaissances arrêtées au 31 décembre 2024. Son entraînement reste particulièrement marquant : 5,0 × 10²⁶ FLOP, soit environ 64 000 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 387,8 millions de dollars.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 9 juillet 2025 |
| Connaissances jusqu'à | 2024-12-31 |
| Multimodal | oui |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 91,7 % | 36ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT25 | 90,0 % | 6ᵉ / 25 | llm-stats | Auto-déclaré |
| GPQA | 87,5 % | 34ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 79,0 % | 13ᵉ / 72 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 40,0 % | 32ᵉ / 89 | llm-stats | Auto-déclaré |
| USAMO25 | 37,5 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| ARC-AGI v2 | 15,9 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 5,0 × 10²⁶ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 387 842 678 $ (USD 2023) |
| Nombre de puces | 200 000 |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Grok-4 figurait dans le top 1% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Il obtenait également de solides résultats sur OTIS Mock AIME 2024-2025, qui évalue les mathématiques de niveau olympiade au lycée. Ces performances plaçaient alors le modèle dans le haut du panier pour le raisonnement scientifique et mathématique. Sa fenêtre de 256 000 tokens constitue aussi une caractéristique notable pour le traitement de longs contextes.
Limites et points d’attention. Ses résultats sont nettement moins convaincants sur SimpleQA Verified, consacré aux réponses factuelles vérifiables, ainsi que sur les problèmes d’échecs. FrontierMath révèle surtout une forte baisse face aux mathématiques de recherche les plus difficiles, jusqu’à un score de 2% sur Tier 4. Environ un an après sa sortie, ses performances sont aujourd’hui largement dépassées et ce type d’ancienne version est souvent retiré du catalogue de l’éditeur. Grok-4 reste néanmoins représentatif d’un effort d’entraînement exceptionnel, équivalent à environ 138,9 millions d’heures-GPU H100 et estimé à 387,8 millions de dollars.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.