Mistral Small 3.2 24B Instruct

Sorti le 20 juin 2025, Mistral Small 3.2 24B Instruct est déjà ancien à l’échelle de l’IA. Près d’un an représente un cycle très long dans ce secteur : le modèle est désormais largement dépassé et souvent retiré du catalogue de son éditeur, Mistral AI.

Sorti le 20 juin 2025, Mistral Small 3.2 24B Instruct est déjà ancien à l’échelle de l’IA. Près d’un an représente un cycle très long dans ce secteur : le modèle est désormais largement dépassé et souvent retiré du catalogue de son éditeur, Mistral AI.

Ce LLM de 24 milliards de paramètres associe des poids ouverts sous licence Apache 2.0 à une fenêtre de contexte de 256 000 tokens. Cette mise à jour mineure améliore le suivi d’instructions, limite les générations répétitives et renforce le function calling. Elle fonctionne avec vLLM et transformers.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie20 juin 2025
Connaissances jusqu'à2023-10-01
Multimodaloui
Paramètres24 milliards
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)image,text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 251benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %23ᵉ / 259benchable✅ Mesuré
Benchable : General Knowledge (Baseline)98,5 %142ᵉ / 252benchable✅ Mesuré
Benchable : Hallucinations (Baseline)96,0 %106ᵉ / 233benchable✅ Mesuré
Benchable : Coding (Baseline)86,0 %153ᵉ / 253benchable✅ Mesuré
Benchable : Mathematics (Baseline)85,0 %148ᵉ / 226benchable✅ Mesuré
Benchable : Reasoning (Baseline)60,0 %174ᵉ / 246benchable✅ Mesuré
Benchable : Instruction Following (Baseline)51,0 %185ᵉ / 256benchable✅ Mesuré
DocVQA94,9 %5ᵉ / 26llm-statsAuto-déclaré
AI2D92,9 %6ᵉ / 32llm-statsAuto-déclaré
ChartQA87,4 %8ᵉ / 24llm-statsAuto-déclaré
MMLU80,5 %56ᵉ / 98llm-statsAuto-déclaré
MATH69,4 %39ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro69,1 %81ᵉ / 125llm-statsAuto-déclaré
MathVista67,1 %21ᵉ / 38llm-statsAuto-déclaré
Wild Bench65,3 %4ᵉ / 8llm-statsAuto-déclaré
MMMU62,5 %39ᵉ / 61llm-statsAuto-déclaré
GPQA46,1 %175ᵉ / 221llm-statsAuto-déclaré
Arena Hard43,1 %21ᵉ / 26llm-statsAuto-déclaré
SimpleQA12,1 %37ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Mistral Small 3.2 24B I…100 %
command-r-plus-08-202499 %

Benchable : Email Classification (Baseline)

GLM-4.6100 %
▶ Mistral Small 3.2 24B I…99 %

Classements Arena (Elo)

Arena Text · 199 modèles classés

RangModèleElo
1ᵉClaude Fable 51509
2ᵉClaude Opus 4.61505
3ᵉClaude Opus 4.71502
179ᵉgemini-2.0-flash-0011360
180ᵉDeepSeek-V31359
181ᵉMistral Small 3.2 24B Instruct1357
182ᵉxAI: Grok 3 Mini Beta1357
183ᵉPrime Intellect: INTELLECT-31356

Arena Vision · 145 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉQwen3.8 Max1305
3ᵉClaude Opus 4.71303
101ᵉstep-31144
102ᵉgemini-1.5-flash-0021141
103ᵉMistral Small 3.2 24B Instruct1141
104ᵉgemini-2.0-flash-lite-preview-02-051136
105ᵉClaude 3.5 Haiku1128

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,075 $0,2 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 73,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable3 min 27 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Mistral Small 3.2 24B Instruct figurait dans le top 65% des LLM de sa génération sur GPQA. Ses meilleurs résultats concernent Ethics et Email Classification, mais ces benchmarks plafonnés départagent peu les modèles. Sa fenêtre de contexte étendue, ses poids ouverts et sa licence commerciale permissive facilitent les déploiements contrôlés. Son principal avantage reste son coût : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 73.3 fois sous celle des modèles frontière.

Limites et points d’attention. Les résultats en Coding et Mathematics restent en retrait. Dans Arena text, le modèle occupe le 182e rang sur 199, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Le premier est nettement devant. Dans Arena vision, il se classe 103e sur 145, derrière Claude Fable 5, Qwen3.8 Max et Claude Opus 4.7. Là encore, le premier est nettement devant. Ses connaissances s’arrêtent au 1er octobre 2023 et ses performances sont aujourd’hui largement dépassées. Il reste pertinent pour des expérimentations économiques fondées sur des poids ouverts. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.7 ou Qwen3.8 Max.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).