Mistral Small 3 24B Base

Sorti le 30 janvier 2025, Mistral Small 3 24B Base est un modèle de langage de base de Mistral AI. Son ancienneté d’environ un an est déjà très longue à l’échelle de l’IA : il doit être comparé aux modèles de sa génération, ses performances étant probablement dépassées aujourd’hui.

Sorti le 30 janvier 2025, Mistral Small 3 24B Base est un modèle de langage de base de Mistral AI. Son ancienneté d’environ un an est déjà très longue à l’échelle de l’IA : il doit être comparé aux modèles de sa génération, ses performances étant probablement dépassées aujourd’hui.

Ses 24 milliards de paramètres s’accompagnent d’une fenêtre de contexte de 32k et du tokenizer Tekken, doté d’un vocabulaire de 131k. Le modèle couvre des dizaines de langues, notamment le français, l’anglais, l’allemand, l’espagnol, l’italien, le chinois, le japonais et le coréen.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie30 janvier 2025
Connaissances jusqu'à2023-10-01
Multimodaloui
Paramètres24 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ARC-C91,3 %9ᵉ / 34llm-statsAuto-déclaré
GSM8k80,7 %38ᵉ / 47llm-statsAuto-déclaré
MMLU80,7 %53ᵉ / 98llm-statsAuto-déclaré
TriviaQA80,3 %6ᵉ / 18llm-statsAuto-déclaré
MBPP69,6 %22ᵉ / 33llm-statsAuto-déclaré
AGIEval65,8 %1ᵉ / 10llm-statsAuto-déclaré
MMLU-Pro54,4 %105ᵉ / 125llm-statsAuto-déclaré
MATH46,0 %61ᵉ / 70llm-statsAuto-déclaré
GPQA34,4 %200ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Mistral Small 3 24B Base se situait dans le top 85% des 61 LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son positionnement de modèle de base à 24 milliards de paramètres est complété par des capacités conversationnelles et de raisonnement avancées. Sa prise en charge de dizaines de langues élargit son champ d’application au-delà de l’anglais. La fenêtre de contexte de 32k autorise le traitement de séquences étendues, tandis que le vocabulaire de 131k du tokenizer Tekken accompagne cette couverture multilingue. La licence Apache 2.0 permet l’usage, la modification et l’exploitation commerciale ou non commerciale des poids ouverts.

Limites et points d’attention. Avec des connaissances arrêtées au 1er octobre 2023, le modèle ne couvre pas les événements et informations ultérieurs. Son âge le pénalise également : après environ un an, durée très longue dans ce secteur, ses performances sont probablement largement dépassées par celles de modèles plus récents. Les modèles de cette période sont aussi souvent retirés du catalogue de leur éditeur. Son classement GPQA à sa sortie le situait dans le top 85% de sa génération, sans le placer parmi les références les plus solides sur ce test.


Sources des données : LLM-Stats (llm-stats.com).