Grok-3 Mini
Grok-3 Mini est un LLM propriétaire de xAI, lancé le 17 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles plus récents. Ses connaissances s’arrêtent au 17 novembre 2024.
Grok-3 Mini est un LLM propriétaire de xAI, lancé le 17 février 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles plus récents. Ses connaissances s’arrêtent au 17 novembre 2024.
Le modèle se distingue par une fenêtre de contexte de 131 072 tokens et un positionnement très économique. Ses tarifs sont inférieurs de 85% à la moyenne des LLM similaires et environ 18,3 fois moins élevés que ceux des modèles frontière. Ses poids ne sont pas ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | xAI |
| Poids | 🔒 Propriétaire |
| Date de sortie | 17 février 2025 |
| Connaissances jusqu'à | 2024-11-17 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 22.5 | 91ᵉ / 137 |
| Math Index | 84.7 | 16ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 95,8 % | 1ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 90,8 % | 41ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 84,0 % | 55ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench | 80,4 % | 8ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 167ᵉ | MiniMax M1 | 1364 |
| 168ᵉ | o3-mini | 1363 |
| 169ᵉ | Grok-3 Mini | 1362 |
| 170ᵉ | Nemotron 3 Super (120B A12B) | 1362 |
| 171ᵉ | gemini-2.0-flash-001 | 1360 |
Notre analyse
Forces. À sa sortie, Grok-3 Mini se classait dans le top 6% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Les mathématiques constituaient son principal point fort : il reste bien classé sur le Math Index et sur MATH level 5, tandis que son résultat à OTIS Mock AIME confirme de bonnes aptitudes sur des problèmes d’olympiades de niveau lycée. Son contexte de 131 072 tokens et son coût très inférieur à celui des modèles haut de gamme complétaient ce positionnement.
Limites et points d'attention. Son Intelligence Index se situe désormais dans le bas du classement, comme son rang dans l’Arena text. SimpleQA Verified révèle une faible fiabilité sur les questions factuelles vérifiables. Les mathématiques de recherche restent également hors de portée : le résultat tombe à 6% sur FrontierMath Private et à 0% sur FrontierMath Tier 4, malgré un classement relatif dans le top 10 de cette dernière évaluation. Après environ un an, une durée très longue dans ce secteur, ses performances sont largement dépassées et les modèles de cette ancienneté sont souvent retirés des catalogues des éditeurs.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.