Mistral Small 3

Publié par Mistral AI le 25 janvier 2025, Mistral Small 3 est un LLM désormais ancien à l’échelle de l’IA. Après environ un an, il appartient à une génération déjà largement dépassée par le rythme de renouvellement du secteur.

Publié par Mistral AI le 25 janvier 2025, Mistral Small 3 est un LLM désormais ancien à l’échelle de l’IA. Après environ un an, il appartient à une génération déjà largement dépassée par le rythme de renouvellement du secteur.

À sa sortie, le modèle se situait dans le top 43% des LLM de sa génération sur GPQA diamond, un test de questions scientifiques de niveau doctorat. Ses résultats dessinent toutefois un profil inégal, plus solide sur ce benchmark que sur les problèmes de mathématiques de compétition. Deux sources de données concordantes étayent cette évaluation.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie25 janvier 2025

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond45,3 %52ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 544,8 %30ᵉ / 59epoch✅ Mesuré
Epoch: OTIS Mock AIME 2024-20255,3 %47ᵉ / 64epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Tulu 346 %
▶ Mistral Small 345 %

Epoch: MATH level 5

GPT-598 %
▶ Mistral Small 345 %
Tulu 343 %

Notre analyse

Forces. À sa sortie, Mistral Small 3 appartenait à la partie supérieure de sa génération sur GPQA diamond, parmi les modèles publiés au cours des quelque 18 mois précédents. Cette position indique des aptitudes scientifiques alors compétitives, sans placer le modèle parmi les références dominantes. Sur MATH level 5, son score brut reste comparable à celui obtenu sur GPQA diamond, même si son classement relatif est moins favorable.

Limites et points d'attention. Le modèle apparaît nettement plus faible sur OTIS Mock AIME 2024-2025, consacré aux olympiades de mathématiques de niveau lycée, où il figure près du bas du classement. Il reste également dans la seconde moitié du tableau sur MATH level 5 et se classe très loin des meilleurs sur GPQA diamond dans la comparaison élargie. Environ un an après sa sortie, ces performances sont probablement largement dépassées par celles des modèles plus récents. Mistral Small 3 relève ainsi surtout d’un jalon de la génération 2025, une catégorie de modèles anciens souvent retirés du catalogue de leur éditeur.


Sources des données : LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.