Mistral NeMo
Publié par Mistral AI le 18 juillet 2024, Mistral NeMo appartient déjà à une génération ancienne de LLM. Près de deux ans représentent une durée très longue dans l’IA, où les modèles sont rapidement dépassés et fréquemment retirés des catalogues.
Publié par Mistral AI le 18 juillet 2024, Mistral NeMo appartient déjà à une génération ancienne de LLM. Près de deux ans représentent une durée très longue dans l’IA, où les modèles sont rapidement dépassés et fréquemment retirés des catalogues.
À sa sortie, Mistral NeMo se classait dans le top 72% des 29 LLM de sa génération sur GPQA diamond. Son profil apparaît contrasté : les scores bruts sont solides en connaissances générales, en classification d’e-mails et en code, mais les rangs relatifs restent bas face aux autres modèles évalués.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 18 juillet 2024 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 93,0 % | 139ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 84,2 % | 137ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 79,0 % | 118ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 62,0 % | 123ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 37,0 % | 130ᵉ / 163 | benchable | ✅ Mesuré |
| Epoch: GPQA diamond | 29,9 % | 75ᵉ / 85 | epoch | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 28,0 % | 138ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 15,0 % | 130ᵉ / 140 | benchable | ✅ Mesuré |
| Epoch: MATH level 5 | 10,8 % | 53ᵉ / 59 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Email Classification (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0 $ |
| Latence moyenne par benchmark — Benchable | 3 min 01 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Mistral NeMo atteint 100% sur Ethics, mais partage la première place avec 71 autres modèles sur un benchmark plafonné et peu discriminant. Ses résultats bruts sont également élevés en classification d’e-mails, en connaissances générales et en code. Ces scores montrent des bases exploitables sur des tâches structurées et des questions générales. À son époque, son classement dans le top 72% sur GPQA diamond le situait dans une large partie supérieure de sa génération, sans le placer parmi les références les plus performantes.
Limites et points d’attention. Les classements Benchable replacent ces scores dans un contexte moins favorable. Mistral NeMo se situe en retrait en classification d’e-mails, en connaissances générales et en code. Son principal point faible concerne Instruction Following, où il n’atteint que 37% et occupe le rang 130 sur 163. Le résultat sur Hallucinations reste également bas, au rang 123 sur 146. Cette combinaison limite sa fiabilité pour exécuter précisément des consignes et produire des réponses factuelles. Après près de deux ans, ses performances sont probablement largement dépassées, et les modèles de cette période sont souvent retirés du catalogue de leur éditeur.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).