Grok-2
Grok-2 est un LLM propriétaire de xAI, lancé aux États-Unis le 13 août 2024. Près de deux ans plus tard, il appartient à une génération ancienne à l’échelle de l’IA, désormais largement dépassée par les modèles haut de gamme plus récents.
Grok-2 est un LLM propriétaire de xAI, lancé aux États-Unis le 13 août 2024. Près de deux ans plus tard, il appartient à une génération ancienne à l’échelle de l’IA, désormais largement dépassée par les modèles haut de gamme plus récents.
Le modèle conserve deux caractéristiques marquantes : une fenêtre de contexte de 131 072 tokens et un entraînement estimé à 3,0 × 10²⁵ FLOP. Cet effort représente environ 8,2 millions d’heures-GPU H100, pour un coût estimé à 31,6 millions de dollars, aux prix de 2023.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 13 août 2024 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 93,6 % | 9ᵉ / 26 | llm-stats | Auto-déclaré |
| HumanEval | 88,4 % | 20ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 87,5 % | 21ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 76,1 % | 26ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 75,5 % | 68ᵉ / 125 | llm-stats | Auto-déclaré |
| MathVista | 69,0 % | 16ᵉ / 38 | llm-stats | Auto-déclaré |
| MMMU | 66,1 % | 35ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 56,0 % | 153ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text-to-Image · 225 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | GPT Image 2 | 1385 |
| 2ᵉ | GPT Image 2 | 1372 |
| 3ᵉ | Microsoft: MAI-Image-2.5 | 1321 |
| ⋯ | ⋯ | |
| 209ᵉ | Bria 3.2 | 903 |
| 210ᵉ | Bagel | 898 |
| 211ᵉ | Grok-2 | 896 |
| 212ᵉ | Stable Diffusion 3 Large Turbo | 896 |
| 213ᵉ | Firefly Image 4 | 890 |
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,0 × 10²⁵ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 31 602 311 $ (USD 2023) |
| Matériel | NVIDIA H100 SXM5 80GB |
| Pays | United States of America |
Notre analyse
Forces. À sa sortie, Grok-2 se classait dans le top 7% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce résultat le situait alors dans le haut du panier pour le raisonnement scientifique. Sur MATH level 5, il reste dans la première moitié du classement étudié, ce qui indique une aptitude encore mesurable sur des problèmes mathématiques exigeants. Sa fenêtre de 131 072 tokens autorise par ailleurs le traitement de volumes de texte importants. Ses connaissances s’arrêtent au 31 mai 2024.
Limites et points d’attention. Les classements actuels montrent un net décrochage : Grok-2 occupe la dernière place de l’Arena text et se situe dans la partie basse de l’Arena text-to-image. Ses résultats sont également faibles sur les olympiades de mathématiques et presque nuls sur FrontierMath, qui évalue des problèmes de recherche très difficiles. Après près de deux ans, il appartient à une génération probablement dépassée et souvent retirée des catalogues. Le contraste reste notable entre ces performances actuelles et l’effort d’entraînement, équivalent à environ 3 800 GPU H100 pendant trois mois, pour 31,6 millions de dollars estimés.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.