Mistral Large
Mistral Large est un LLM français lancé par Mistral AI le 26 février 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur.
Mistral Large est un LLM français lancé par Mistral AI le 26 février 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur.
Le modèle associe une fenêtre de contexte de 128 000 tokens à des connaissances arrêtées au 30 novembre 2024. Son tarif est économique, 4 % sous la moyenne des LLM similaires et environ 2,8 fois inférieur à celui des modèles frontière. Son entraînement aurait mobilisé 1.1 × 10²⁵ FLOP, pour un coût estimé à 14.1 millions de dollars.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 26 février 2024 |
| Connaissances jusqu'à | 2024-11-30 |
| Multimodal | oui |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 98,5 % | 84ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 82,0 % | 104ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 64,0 % | 98ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 63,0 % | 74ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 38,8 % | 61ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 24,5 % | 40ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 1,9 % | 59ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Ethics (Baseline)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Mistral | 2 $ | 6 $ | 0,2 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,07 $ |
| Latence moyenne par benchmark — Benchable | 3 min 06 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 1,1 × 10²⁵ FLOP |
| Jeu de données | Unspecified unreleased |
| Coût d'entraînement estimé | ≈ 14 110 112 $ (USD 2023) |
| Matériel | NVIDIA H100 SXM5 80GB |
| Durée d'entraînement | 2 500 h |
| Pays | France |
Notre analyse
Forces. À sa sortie, Mistral Large figurait dans le top 29% des 14 LLM de sa génération sur GPQA diamond. Les résultats Benchable indiquent de bons scores bruts en classification d’e-mails, en connaissances générales et en mathématiques. Les tests Hallucinations et Ethics atteignent leur plafond, mais les premières places y sont partagées avec respectivement 45 et 71 autres modèles. Ces résultats sont donc peu discriminants. La fenêtre de contexte de 128 000 tokens constitue un autre élément notable. Le positionnement tarifaire reste économique face aux modèles similaires et aux modèles frontière.
Limites et points d’attention. Le classement en Coding est en retrait, avec une 104e place partagée sur 162 modèles. Le résultat en connaissances générales se situe également dans la seconde moitié du classement. Après près de deux ans, les performances de Mistral Large sont aujourd’hui largement dépassées et le modèle est souvent absent des catalogues récents de l’éditeur. Son effort d’entraînement reste marquant à l’échelle de sa période : environ 3.1 millions d’heures-GPU H100, soit près de 1 400 GPU H100 pendant trois mois, pour un coût estimé à 14.1 millions de dollars de 2023.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).