Mistral Large

Mistral Large est un LLM français lancé par Mistral AI le 26 février 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur.

Mistral Large est un LLM français lancé par Mistral AI le 26 février 2024. Près de deux ans plus tard, il appartient à une génération déjà très ancienne à l’échelle de l’IA. Ses performances sont probablement dépassées et ce type de modèle est souvent retiré du catalogue de son éditeur.

Le modèle associe une fenêtre de contexte de 128 000 tokens à des connaissances arrêtées au 30 novembre 2024. Son tarif est économique, 4 % sous la moyenne des LLM similaires et environ 2,8 fois inférieur à celui des modèles frontière. Son entraînement aurait mobilisé 1.1 × 10²⁵ FLOP, pour un coût estimé à 14.1 millions de dollars.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie26 février 2024
Connaissances jusqu'à2024-11-30
Multimodaloui
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,file → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)98,5 %84ᵉ / 161benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)82,0 %104ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)64,0 %98ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)63,0 %74ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond38,8 %61ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 524,5 %40ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20251,9 %59ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ Mistral Large100 %

Benchable : Ethics (Baseline)

▶ Mistral Large100 %
command-r-plus-08-202499 %

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Mistral2 $6 $0,2 $

Prix en dollars US par million de tokens.

Sa tarification se situe 4 % en dessous de la moyenne des LLM similaires, et 2,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,07 $
Latence moyenne par benchmark — Benchable3 min 06 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement1,1 × 10²⁵ FLOP
Jeu de donnéesUnspecified unreleased
Coût d'entraînement estimé≈ 14 110 112 $ (USD 2023)
MatérielNVIDIA H100 SXM5 80GB
Durée d'entraînement2 500 h
PaysFrance

Notre analyse

Forces. À sa sortie, Mistral Large figurait dans le top 29% des 14 LLM de sa génération sur GPQA diamond. Les résultats Benchable indiquent de bons scores bruts en classification d’e-mails, en connaissances générales et en mathématiques. Les tests Hallucinations et Ethics atteignent leur plafond, mais les premières places y sont partagées avec respectivement 45 et 71 autres modèles. Ces résultats sont donc peu discriminants. La fenêtre de contexte de 128 000 tokens constitue un autre élément notable. Le positionnement tarifaire reste économique face aux modèles similaires et aux modèles frontière.

Limites et points d’attention. Le classement en Coding est en retrait, avec une 104e place partagée sur 162 modèles. Le résultat en connaissances générales se situe également dans la seconde moitié du classement. Après près de deux ans, les performances de Mistral Large sont aujourd’hui largement dépassées et le modèle est souvent absent des catalogues récents de l’éditeur. Son effort d’entraînement reste marquant à l’échelle de sa période : environ 3.1 millions d’heures-GPU H100, soit près de 1 400 GPU H100 pendant trois mois, pour un coût estimé à 14.1 millions de dollars de 2023.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).