Grok-2

Grok-2 est un LLM propriétaire de xAI, lancé aux États-Unis le 13 août 2024. Près de deux ans plus tard, il appartient à une génération ancienne à l’échelle de l’IA, désormais largement dépassée par les modèles haut de gamme plus récents.

Grok-2 est un LLM propriétaire de xAI, lancé aux États-Unis le 13 août 2024. Près de deux ans plus tard, il appartient à une génération ancienne à l’échelle de l’IA, désormais largement dépassée par les modèles haut de gamme plus récents.

Le modèle conserve deux caractéristiques marquantes : une fenêtre de contexte de 131 072 tokens et un entraînement estimé à 3,0 × 10²⁵ FLOP. Cet effort représente environ 8,2 millions d’heures-GPU H100, pour un coût estimé à 31,6 millions de dollars, aux prix de 2023.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie13 août 2024
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA93,6 %9ᵉ / 26llm-statsAuto-déclaré
HumanEval88,4 %20ᵉ / 65llm-statsAuto-déclaré
MMLU87,5 %21ᵉ / 98llm-statsAuto-déclaré
MATH76,1 %26ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro75,5 %68ᵉ / 125llm-statsAuto-déclaré
MathVista69,0 %16ᵉ / 38llm-statsAuto-déclaré
MMMU66,1 %35ᵉ / 61llm-statsAuto-déclaré
GPQA56,0 %153ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text-to-Image · 225 modèles classés

RangModèleElo
1ᵉGPT Image 21385
2ᵉGPT Image 21372
3ᵉMicrosoft: MAI-Image-2.51321
209ᵉBria 3.2903
210ᵉBagel898
211ᵉGrok-2896
212ᵉStable Diffusion 3 Large Turbo896
213ᵉFirefly Image 4890

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,0 × 10²⁵ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 31 602 311 $ (USD 2023)
MatérielNVIDIA H100 SXM5 80GB
PaysUnited States of America

Notre analyse

Forces. À sa sortie, Grok-2 se classait dans le top 7% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ce résultat le situait alors dans le haut du panier pour le raisonnement scientifique. Sur MATH level 5, il reste dans la première moitié du classement étudié, ce qui indique une aptitude encore mesurable sur des problèmes mathématiques exigeants. Sa fenêtre de 131 072 tokens autorise par ailleurs le traitement de volumes de texte importants. Ses connaissances s’arrêtent au 31 mai 2024.

Limites et points d’attention. Les classements actuels montrent un net décrochage : Grok-2 occupe la dernière place de l’Arena text et se situe dans la partie basse de l’Arena text-to-image. Ses résultats sont également faibles sur les olympiades de mathématiques et presque nuls sur FrontierMath, qui évalue des problèmes de recherche très difficiles. Après près de deux ans, il appartient à une génération probablement dépassée et souvent retirée des catalogues. Le contraste reste notable entre ces performances actuelles et l’effort d’entraînement, équivalent à environ 3 800 GPU H100 pendant trois mois, pour 31,6 millions de dollars estimés.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.