Mistral Small 3 24B Instruct

Publié par Mistral AI le 30 janvier 2025, Mistral Small 3 24B Instruct est déjà ancien à l’échelle de l’IA. Ce modèle de 24 milliards de paramètres, affiné pour suivre des instructions, correspond désormais davantage à une génération passée qu’aux offres les plus récentes.

Publié par Mistral AI le 30 janvier 2025, Mistral Small 3 24B Instruct est déjà ancien à l’échelle de l’IA. Ce modèle de 24 milliards de paramètres, affiné pour suivre des instructions, correspond désormais davantage à une génération passée qu’aux offres les plus récentes.

Ses principaux marqueurs restent une licence Apache 2.0 autorisant l’usage commercial, des poids ouverts, une fenêtre de contexte de 32 768 tokens et la prise en charge de dizaines de langues. Il combine aussi prompts système, function calling natif et sortie JSON, avec une exécution possible sous vLLM ou Transformers.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie30 janvier 2025
Connaissances jusqu'à2023-10-01
Multimodalnon
Paramètres24 milliards
Fenêtre de contexte32 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Arena Hard87,6 %5ᵉ / 26llm-statsAuto-déclaré
HumanEval84,8 %36ᵉ / 65llm-statsAuto-déclaré
MT-Bench83,5 %8ᵉ / 12llm-statsAuto-déclaré
IFEval82,9 %47ᵉ / 65llm-statsAuto-déclaré
MATH70,6 %36ᵉ / 70llm-statsAuto-déclaré
MMLU-Pro66,3 %95ᵉ / 125llm-statsAuto-déclaré
Wild Bench52,2 %6ᵉ / 8llm-statsAuto-déclaré
GPQA45,3 %177ᵉ / 219llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,05 $0,08 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 110 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, son résultat sur GPQA le plaçait dans le top 62 % des 61 LLM de sa génération, soit une position correcte sans appartenir au groupe de tête. Son intérêt tient surtout à son rapport entre coût et possibilités techniques : ses tarifs sont 97 % inférieurs à la moyenne des LLM similaires et environ 110 fois inférieurs à ceux des modèles frontière. Son tokenizer Tekken repose sur un vocabulaire de 131 000 unités. Le modèle couvre notamment le français, l’anglais, l’allemand, l’espagnol, l’italien, le chinois, le japonais, le coréen, le portugais, le néerlandais et le polonais. Ses poids ouverts facilitent aussi l’inférence locale ou le déploiement en configuration serveur/client.

Limites et points d’attention. Environ un an après sa sortie, ses performances sont largement dépassées par les générations plus récentes et ce type de modèle est souvent retiré du catalogue actif de l’éditeur. Son classement GPQA d’époque indiquait déjà un niveau intermédiaire plutôt qu’une position de référence. Ses connaissances s’arrêtent au 1er octobre 2023, ce qui limite sa pertinence sur les événements et évolutions ultérieurs. Enfin, sa fenêtre de 32 768 tokens reste le plafond de traitement annoncé, tandis que ses 24 milliards de paramètres impliquent un modèle sensiblement plus volumineux que les petites architectures destinées aux déploiements les plus contraints.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).