Mistral: Mistral Medium 3
Publié le 7 mai 2025 par Mistral AI, Mistral Medium 3 est déjà ancien à l’échelle de l’IA. Environ un an sépare ce LLM des références actuelles, un délai très long dans ce secteur. Les modèles de cette période sont généralement dépassés et souvent retirés du catalogue de leur éditeur.
Publié le 7 mai 2025 par Mistral AI, Mistral Medium 3 est déjà ancien à l’échelle de l’IA. Environ un an sépare ce LLM des références actuelles, un délai très long dans ce secteur. Les modèles de cette période sont généralement dépassés et souvent retirés du catalogue de leur éditeur.
À sa sortie, il figurait dans le top 23% des 56 LLM de sa génération sur GPQA diamond. Il associait une fenêtre de contexte de 131 072 tokens à un positionnement très économique, avec une tarification inférieure de 81% à la moyenne des LLM similaires et environ 13,8 fois moins élevée que celle des modèles frontière.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 7 mai 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | oui |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text,image,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 87,0 % | 87ᵉ / 162 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 81,6 % | 16ᵉ / 59 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 72,0 % | 89ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 64,0 % | 71ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 59,5 % | 37ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 32,2 % | 34ᵉ / 64 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Private | 0,3 % | 30ᵉ / 32 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-2025-02-28-Public | 0,0 % | 17ᵉ / 33 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : General Knowledge (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Mistral | 0,4 $ | 2 $ | 0,04 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 5 min 27 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Mistral Medium 3 se situait dans le haut du panier de sa génération sur GPQA diamond lors de sa sortie. Sur Benchable, il atteint le plafond en General Knowledge, Ethics et Hallucinations, avec de nombreux ex æquo. La classification d’e-mails atteint également 99% et partage la 11e place avec 40 autres modèles. Son résultat en Mathematics reste solide. Sa fenêtre de 131 072 tokens accepte des entrées volumineuses. Son principal avantage concret reste son coût, fixé à 0,4 $ par million de tokens en entrée et 2 $ en sortie.
Limites et points d'attention. Les scores parfaits de Benchable sont plafonnés et peu discriminants: Mistral Medium 3 partage ces résultats avec 45 autres modèles en Hallucinations, 41 en General Knowledge et 71 en Ethics. En Coding, son score de 87% le place dans la seconde moitié du classement. En Mathematics, il reste hors de la tête du tableau malgré ses 93%. Ses connaissances s’arrêtent au 31 mars 2025. Son ancienneté d’environ un an rend aujourd’hui ses performances largement dépassées, et les modèles de cette période ne restent souvent plus proposés par leur éditeur.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).