Grok-3 Mini

Grok-3 Mini est un LLM propriétaire de xAI, lancé le 17 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles plus récents. Ses connaissances s’arrêtent au 17 novembre 2024.

Grok-3 Mini est un LLM propriétaire de xAI, lancé le 17 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles plus récents. Ses connaissances s’arrêtent au 17 novembre 2024.

Le modèle se distingue par une fenêtre de contexte de 131 072 tokens et un positionnement très économique. Ses tarifs sont inférieurs de 85% à la moyenne des LLM similaires et environ 18,3 fois moins élevés que ceux des modèles frontière. Ses poids ne sont pas ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurxAI
Poids🔒 Propriétaire
Date de sortie17 février 2025
Connaissances jusqu'à2024-11-17
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index22.591ᵉ / 137
Math Index84.716ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202495,8 %1ᵉ / 52llm-statsAuto-déclaré
AIME 202590,8 %41ᵉ / 108llm-statsAuto-déclaré
GPQA84,0 %55ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench80,4 %8ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ Grok-3 Mini22.5
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Grok-3 Mini84.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
167ᵉMiniMax M11364
168ᵉo3-mini1363
169ᵉGrok-3 Mini1362
170ᵉNemotron 3 Super (120B A12B)1362
171ᵉgemini-2.0-flash-0011360

Notre analyse

Forces. À sa sortie, Grok-3 Mini se classait dans le top 6% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Les mathématiques constituaient son principal point fort : il reste bien classé sur le Math Index et sur MATH level 5, tandis que son résultat à OTIS Mock AIME confirme de bonnes aptitudes sur des problèmes d’olympiades de niveau lycée. Son contexte de 131 072 tokens et son coût très inférieur à celui des modèles haut de gamme complétaient ce positionnement.

Limites et points d'attention. Son Intelligence Index se situe désormais dans le bas du classement, comme son rang dans l’Arena text. SimpleQA Verified révèle une faible fiabilité sur les questions factuelles vérifiables. Les mathématiques de recherche restent également hors de portée : le résultat tombe à 6% sur FrontierMath Private et à 0% sur FrontierMath Tier 4, malgré un classement relatif dans le top 10 de cette dernière évaluation. Après environ un an, une durée très longue dans ce secteur, ses performances sont largement dépassées et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.