Mistral Small 3.2 24B Instruct
Sorti le 20 juin 2025, Mistral Small 3.2 24B Instruct est déjà ancien à l’échelle de l’IA. Près d’un an représente un cycle très long dans ce secteur : le modèle est désormais largement dépassé et souvent retiré du catalogue de son éditeur, Mistral AI.
Sorti le 20 juin 2025, Mistral Small 3.2 24B Instruct est déjà ancien à l’échelle de l’IA. Près d’un an représente un cycle très long dans ce secteur : le modèle est désormais largement dépassé et souvent retiré du catalogue de son éditeur, Mistral AI.
Ce LLM de 24 milliards de paramètres associe des poids ouverts sous licence Apache 2.0 à une fenêtre de contexte de 256 000 tokens. Cette mise à jour mineure améliore le suivi d’instructions, limite les générations répétitives et renforce le function calling. Elle fonctionne avec vLLM et transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 20 juin 2025 |
| Connaissances jusqu'à | 2023-10-01 |
| Multimodal | oui |
| Paramètres | 24 milliards |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | image,text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 251 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 23ᵉ / 259 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 98,5 % | 142ᵉ / 252 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 96,0 % | 106ᵉ / 233 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 86,0 % | 153ᵉ / 253 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 85,0 % | 148ᵉ / 226 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 60,0 % | 174ᵉ / 246 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 51,0 % | 185ᵉ / 256 | benchable | ✅ Mesuré |
| DocVQA | 94,9 % | 5ᵉ / 26 | llm-stats | Auto-déclaré |
| AI2D | 92,9 % | 6ᵉ / 32 | llm-stats | Auto-déclaré |
| ChartQA | 87,4 % | 8ᵉ / 24 | llm-stats | Auto-déclaré |
| MMLU | 80,5 % | 56ᵉ / 98 | llm-stats | Auto-déclaré |
| MATH | 69,4 % | 39ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 69,1 % | 81ᵉ / 125 | llm-stats | Auto-déclaré |
| MathVista | 67,1 % | 21ᵉ / 38 | llm-stats | Auto-déclaré |
| Wild Bench | 65,3 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| MMMU | 62,5 % | 39ᵉ / 61 | llm-stats | Auto-déclaré |
| GPQA | 46,1 % | 175ᵉ / 221 | llm-stats | Auto-déclaré |
| Arena Hard | 43,1 % | 21ᵉ / 26 | llm-stats | Auto-déclaré |
| SimpleQA | 12,1 % | 37ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Email Classification (Baseline)
Classements Arena (Elo)
Arena Text · 199 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1509 |
| 2ᵉ | Claude Opus 4.6 | 1505 |
| 3ᵉ | Claude Opus 4.7 | 1502 |
| ⋯ | ⋯ | |
| 179ᵉ | gemini-2.0-flash-001 | 1360 |
| 180ᵉ | DeepSeek-V3 | 1359 |
| 181ᵉ | Mistral Small 3.2 24B Instruct | 1357 |
| 182ᵉ | xAI: Grok 3 Mini Beta | 1357 |
| 183ᵉ | Prime Intellect: INTELLECT-3 | 1356 |
Arena Vision · 145 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Qwen3.8 Max | 1305 |
| 3ᵉ | Claude Opus 4.7 | 1303 |
| ⋯ | ⋯ | |
| 101ᵉ | step-3 | 1144 |
| 102ᵉ | gemini-1.5-flash-002 | 1141 |
| 103ᵉ | Mistral Small 3.2 24B Instruct | 1141 |
| 104ᵉ | gemini-2.0-flash-lite-preview-02-05 | 1136 |
| 105ᵉ | Claude 3.5 Haiku | 1128 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,075 $ | 0,2 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 73,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 3 min 27 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Mistral Small 3.2 24B Instruct figurait dans le top 65% des LLM de sa génération sur GPQA. Ses meilleurs résultats concernent Ethics et Email Classification, mais ces benchmarks plafonnés départagent peu les modèles. Sa fenêtre de contexte étendue, ses poids ouverts et sa licence commerciale permissive facilitent les déploiements contrôlés. Son principal avantage reste son coût : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 73.3 fois sous celle des modèles frontière.
Limites et points d’attention. Les résultats en Coding et Mathematics restent en retrait. Dans Arena text, le modèle occupe le 182e rang sur 199, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans Arena vision, il se classe 103e sur 145, derrière Claude Fable 5, Qwen3.8 Max et Claude Opus 4.7. Là encore, le premier est nettement devant. Ses connaissances s’arrêtent au 1er octobre 2023 et ses performances sont aujourd’hui largement dépassées. Il reste pertinent pour des expérimentations économiques fondées sur des poids ouverts. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Qwen3.8 Max.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).