Grok-3
Lancé le 17 février 2025 par l’américain xAI, Grok-3 est un LLM propriétaire de 3000 milliards de paramètres, doté d’une fenêtre de contexte de 131 072 tokens et de connaissances arrêtées au 17 novembre 2024. Environ un an après sa sortie, il est déjà ancien à l’échelle de l’IA et…
Lancé le 17 février 2025 par l’américain xAI, Grok-3 est un LLM propriétaire de 3000 milliards de paramètres, doté d’une fenêtre de contexte de 131 072 tokens et de connaissances arrêtées au 17 novembre 2024. Environ un an après sa sortie, il est déjà ancien à l’échelle de l’IA et largement dépassé par des modèles plus récents.
Son entraînement reste spectaculaire : 3,5 × 10²⁶ FLOP, soit environ 45 000 GPU H100 mobilisés pendant trois mois, pour un coût estimé à 217,8 millions de dollars. À sa sortie, Grok-3 appartenait au top 8% des LLM de sa génération sur GPQA diamond.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 février 2025 |
| Connaissances jusqu'à | 2024-11-17 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 18.4 | 108ᵉ / 137 |
| Math Index | 58.0 | 27ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 93,3 % | 3ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 93,3 % | 25ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 84,6 % | 50ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 79,4 % | 10ᵉ / 72 | llm-stats | Auto-déclaré |
| MMMU | 78,0 % | 16ᵉ / 61 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| xai | 3 $ | 15 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 44 % au-dessus de la moyenne des LLM similaires, et 1,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,5 × 10²⁶ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 217 835 546 $ (USD 2023) |
| Matériel | NVIDIA H100 SXM5 80GB |
| Nombre de puces | 80 000 |
| Puissance électrique | 109 948 656 W |
| Durée d'entraînement | 2 160 h |
| Pays | United States of America |
Notre analyse
Forces. Grok-3 se distinguait surtout par ses résultats scientifiques et mathématiques. À sa sortie, son classement sur GPQA diamond, qui mesure la réponse à des questions scientifiques de niveau doctorat, le plaçait dans le haut du panier de sa génération. Son résultat sur MATH level 5 reste également solide, tandis que son Math Index se situe dans la moitié supérieure des modèles évalués. Sa fenêtre de 131 072 tokens autorise le traitement de volumes de texte importants. Son tarif se place dans la moyenne générale et reste environ 1,8 fois inférieur à celui des modèles frontière.
Limites et points d’attention. Son Intelligence Index se situe désormais dans le bas du classement, signe de performances générales largement dépassées. Les résultats sur FrontierMath révèlent surtout une incapacité à résoudre les problèmes de mathématiques de recherche les plus difficiles, avec 0% sur les deux variantes Tier 4. Le modèle n’est souvent plus proposé par l’éditeur à ce stade de son cycle de vie. Sa tarification reste en outre 51% supérieure à la moyenne des LLM similaires. Enfin, ses poids ne sont pas ouverts, malgré un entraînement estimé à 45 000 GPU H100 pendant trois mois et à 217,8 millions de dollars.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Epoch AI (epoch.ai), CC-BY-4.0.