Mistral: Mistral Medium 3

Publié le 7 mai 2025 par Mistral AI, Mistral Medium 3 est déjà ancien à l’échelle de l’IA. Environ un an sépare ce LLM des références actuelles, un délai très long dans ce secteur. Les modèles de cette période sont généralement dépassés et souvent retirés du catalogue de leur éditeur.

Publié le 7 mai 2025 par Mistral AI, Mistral Medium 3 est déjà ancien à l’échelle de l’IA. Environ un an sépare ce LLM des références actuelles, un délai très long dans ce secteur. Les modèles de cette période sont généralement dépassés et souvent retirés du catalogue de leur éditeur.

À sa sortie, il figurait dans le top 23% des 56 LLM de sa génération sur GPQA diamond. Il associait une fenêtre de contexte de 131 072 tokens à un positionnement très économique, avec une tarification inférieure de 81% à la moyenne des LLM similaires et environ 13,8 fois moins élevée que celle des modèles frontière.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie7 mai 2025
Connaissances jusqu'à2025-03-31
Multimodaloui
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text,image,file → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)87,0 %87ᵉ / 162benchable✅ Mesuré
Epoch: MATH level 581,6 %16ᵉ / 59epoch✅ Mesuré
Benchable : Reasoning (Baseline)72,0 %89ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)64,0 %71ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond59,5 %37ᵉ / 85epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-202532,2 %34ᵉ / 64epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Private0,3 %30ᵉ / 32epoch✅ Mesuré
Epoch: FrontierMath-2025-02-28-Public0,0 %17ᵉ / 33epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Mistral Medium…100 %

Benchable : General Knowledge (Baseline)

▶ Mistral Medium…100 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Mistral0,4 $2 $0,04 $

Prix en dollars US par million de tokens.

Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable5 min 27 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Mistral Medium 3 se situait dans le haut du panier de sa génération sur GPQA diamond lors de sa sortie. Sur Benchable, il atteint le plafond en General Knowledge, Ethics et Hallucinations, avec de nombreux ex æquo. La classification d’e-mails atteint également 99% et partage la 11e place avec 40 autres modèles. Son résultat en Mathematics reste solide. Sa fenêtre de 131 072 tokens accepte des entrées volumineuses. Son principal avantage concret reste son coût, fixé à 0,4 $ par million de tokens en entrée et 2 $ en sortie.

Limites et points d'attention. Les scores parfaits de Benchable sont plafonnés et peu discriminants: Mistral Medium 3 partage ces résultats avec 45 autres modèles en Hallucinations, 41 en General Knowledge et 71 en Ethics. En Coding, son score de 87% le place dans la seconde moitié du classement. En Mathematics, il reste hors de la tête du tableau malgré ses 93%. Ses connaissances s’arrêtent au 31 mars 2025. Son ancienneté d’environ un an rend aujourd’hui ses performances largement dépassées, et les modèles de cette période ne restent souvent plus proposés par leur éditeur.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).