Mistral Small 3.1
Mistral Small 3.1 est un LLM publié par Mistral AI le 17 mars 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne, une durée particulièrement longue dans un secteur où les performances progressent rapidement.
Mistral Small 3.1 est un LLM publié par Mistral AI le 17 mars 2025. Âgé d’environ un an, il appartient déjà à une génération ancienne, une durée particulièrement longue dans un secteur où les performances progressent rapidement.
À sa sortie, le modèle se situait dans le top 44% des LLM de sa génération sur GPQA diamond. Son profil apparaît toutefois inégal : relativement compétitif sur les questions scientifiques avancées et certains problèmes mathématiques, il se montre nettement moins convaincant face aux exercices d’olympiades.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 17 mars 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 47,5 % | 47ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 46,8 % | 28ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 5,8 % | 46ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. À sa sortie, Mistral Small 3.1 appartenait à la moitié supérieure des 75 LLM de sa génération sur GPQA diamond (questions scientifiques de niveau doctorat). Ce positionnement indique une aptitude alors compétitive sur des problèmes scientifiques exigeants. Son résultat à MATH level 5 le place aujourd’hui en milieu de tableau, ce qui constitue sa tenue relative la plus solide parmi les évaluations rapportées. Cette lecture repose sur deux sources de données concordantes.
Limites et points d’attention. Les classements actuels placent Mistral Small 3.1 loin des meilleurs modèles sur GPQA diamond et plus nettement encore sur OTIS Mock AIME 2024-2025 (olympiades de mathématiques de niveau lycée). Son très faible résultat sur ce dernier benchmark révèle une faiblesse marquée en résolution de problèmes mathématiques de compétition. Après environ un an, ses performances sont largement dépassées à l’échelle de l’IA. Les modèles de cette ancienneté sont aussi souvent retirés du catalogue de leur éditeur, ce qui réduit leur pertinence comme choix actuel. Mistral Small 3.1 conserve surtout un intérêt historique pour situer le niveau des LLM publiés au début de 2025.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.