Mistral Small 3
Publié par Mistral AI le 25 janvier 2025, Mistral Small 3 est un LLM désormais ancien à l’échelle de l’IA. Après environ un an, il appartient à une génération déjà largement dépassée par le rythme de renouvellement du secteur.
Publié par Mistral AI le 25 janvier 2025, Mistral Small 3 est un LLM désormais ancien à l’échelle de l’IA. Après environ un an, il appartient à une génération déjà largement dépassée par le rythme de renouvellement du secteur.
À sa sortie, le modèle se situait dans le top 43% des LLM de sa génération sur GPQA diamond, un test de questions scientifiques de niveau doctorat. Ses résultats dessinent toutefois un profil inégal, plus solide sur ce benchmark que sur les problèmes de mathématiques de compétition. Deux sources de données concordantes étayent cette évaluation.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | ▫ n.d. |
| Date de sortie | 25 janvier 2025 |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: GPQA diamond | 45,3 % | 52ᵉ / 85 | epoch | ✅ Mesuré |
| Epoch: MATH level 5 | 44,8 % | 30ᵉ / 59 | epoch | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 5,3 % | 47ᵉ / 64 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: GPQA diamond
Epoch: MATH level 5
Notre analyse
Forces. À sa sortie, Mistral Small 3 appartenait à la partie supérieure de sa génération sur GPQA diamond, parmi les modèles publiés au cours des quelque 18 mois précédents. Cette position indique des aptitudes scientifiques alors compétitives, sans placer le modèle parmi les références dominantes. Sur MATH level 5, son score brut reste comparable à celui obtenu sur GPQA diamond, même si son classement relatif est moins favorable.
Limites et points d'attention. Le modèle apparaît nettement plus faible sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, où il figure près du bas du classement. Il reste également dans la seconde moitié du tableau sur MATH level 5 et se classe très loin des meilleurs sur GPQA diamond dans la comparaison élargie. Environ un an après sa sortie, ces performances sont probablement largement dépassées par celles des modèles plus récents. Mistral Small 3 relève ainsi surtout d’un jalon de la génération 2025, une catégorie de modèles anciens souvent retirés du catalogue de leur éditeur.
Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.