Mistral NeMo

Publié par Mistral AI le 18 juillet 2024, Mistral NeMo appartient déjà à une génération ancienne de LLM. Près de deux ans représentent une durée très longue dans l’IA, où les modèles sont rapidement dépassés et fréquemment retirés des catalogues.

Publié par Mistral AI le 18 juillet 2024, Mistral NeMo appartient déjà à une génération ancienne de LLM. Près de deux ans représentent une durée très longue dans l’IA, où les modèles sont rapidement dépassés et fréquemment retirés des catalogues.

À sa sortie, Mistral NeMo se classait dans le top 72% des 29 LLM de sa génération sur GPQA diamond. Son profil apparaît contrasté : les scores bruts sont solides en connaissances générales, en classification d’e-mails et en code, mais les rangs relatifs restent bas face aux autres modèles évalués.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie18 juillet 2024

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)93,0 %139ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)84,2 %137ᵉ / 161benchable✅ Mesuré
Benchable : Coding (Baseline)79,0 %118ᵉ / 162benchable✅ Mesuré
Benchable : Hallucinations (Baseline)62,0 %123ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)37,0 %130ᵉ / 163benchable✅ Mesuré
Epoch: GPQA diamond29,9 %75ᵉ / 85epoch✅ Mesuré
Benchable : Reasoning (Baseline)28,0 %138ᵉ / 155benchable✅ Mesuré
Benchable : Mathematics (Baseline)15,0 %130ᵉ / 140benchable✅ Mesuré
Epoch: MATH level 510,8 %53ᵉ / 59epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ Mistral NeMo100 %
command-r-plus-08-202499 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
▶ Mistral NeMo93 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0 $
Latence moyenne par benchmark — Benchable3 min 01 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Mistral NeMo atteint 100% sur Ethics, mais partage la première place avec 71 autres modèles sur un benchmark plafonné et peu discriminant. Ses résultats bruts sont également élevés en classification d’e-mails, en connaissances générales et en code. Ces scores montrent des bases exploitables sur des tâches structurées et des questions générales. À son époque, son classement dans le top 72% sur GPQA diamond le situait dans une large partie supérieure de sa génération, sans le placer parmi les références les plus performantes.

Limites et points d’attention. Les classements Benchable replacent ces scores dans un contexte moins favorable. Mistral NeMo se situe en retrait en classification d’e-mails, en connaissances générales et en code. Son principal point faible concerne Instruction Following, où il n’atteint que 37% et occupe le rang 130 sur 163. Le résultat sur Hallucinations reste également bas, au rang 123 sur 146. Cette combinaison limite sa fiabilité pour exécuter précisément des consignes et produire des réponses factuelles. Après près de deux ans, ses performances sont probablement largement dépassées, et les modèles de cette période sont souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).