Mistral: Ministral 8B

Publié par Mistral AI le 17 octobre 2024, Mistral: Ministral 8B est un LLM désormais ancien à l’échelle de l’IA. Près de deux ans après sa sortie, il appartient à une génération probablement dépassée par les modèles plus récents et susceptible de ne plus occuper une place centrale dans…

Publié par Mistral AI le 17 octobre 2024, Mistral: Ministral 8B est un LLM désormais ancien à l’échelle de l’IA. Près de deux ans après sa sortie, il appartient à une génération probablement dépassée par les modèles plus récents et susceptible de ne plus occuper une place centrale dans le catalogue de l’éditeur.

Sa principale caractéristique est une fenêtre de contexte de 128 000 tokens, associée à des connaissances arrêtées au 30 septembre 2024. À sa sortie, il se classait dans le top 85% des LLM de sa génération sur GPQA diamond, un positionnement modeste plutôt qu’une place parmi les modèles dominants de sa période.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids▫ n.d.
Date de sortie17 octobre 2024
Connaissances jusqu'à2024-09-30
Multimodalnon
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Epoch: GPQA diamond27,1 %78ᵉ / 85epoch✅ Mesuré
Epoch: MATH level 514,9 %48ᵉ / 59epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Epoch: GPQA diamond

Yi-1.5-34B32 %
▶ Ministral 8B27 %

Epoch: MATH level 5

GPT-598 %
Hermes 2 Theta Llama-3 …23 %
▶ Ministral 8B15 %
DBRX12 %

Notre analyse

Forces. Mistral: Ministral 8B combine une fenêtre de contexte de 128 000 tokens avec une base de connaissances allant presque jusqu’à sa date de publication. Cet écart réduit entre la coupure des connaissances et la sortie constituait un atout concret en octobre 2024. Son résultat sur MATH level 5 apparaît légèrement moins défavorable que celui obtenu sur GPQA diamond, même s’il reste situé dans la partie basse du classement. Les caractéristiques et résultats présentés reposent sur trois sources de données concordantes.

Limites et points d’attention. Les évaluations disponibles montrent des performances faibles sur les tâches exigeantes. Sur GPQA diamond, qui mesure la réponse à des questions scientifiques de niveau doctorat, le modèle se situe presque en fin de classement. Son score sur MATH level 5 confirme également des difficultés marquées en raisonnement mathématique complexe. Même replacé dans son époque, son appartenance au top 85% de sa génération ne traduit pas un positionnement de premier plan. Près de deux ans après sa sortie, ces résultats sont probablement largement dépassés, tandis que les modèles de cet âge sont souvent retirés des catalogues des éditeurs. Sa coupure des connaissances au 30 septembre 2024 limite aussi sa couverture des événements ultérieurs.


Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · Epoch AI (epoch.ai), CC-BY-4.0.