Mistral Small 3 24B Instruct
Publié par Mistral AI le 30 janvier 2025, Mistral Small 3 24B Instruct est déjà ancien à l’échelle de l’IA. Ce modèle de 24 milliards de paramètres, affiné pour suivre des instructions, correspond désormais davantage à une génération passée qu’aux offres les plus récentes.
Publié par Mistral AI le 30 janvier 2025, Mistral Small 3 24B Instruct est déjà ancien à l’échelle de l’IA. Ce modèle de 24 milliards de paramètres, affiné pour suivre des instructions, correspond désormais davantage à une génération passée qu’aux offres les plus récentes.
Ses principaux marqueurs restent une licence Apache 2.0 autorisant l’usage commercial, des poids ouverts, une fenêtre de contexte de 32 768 tokens et la prise en charge de dizaines de langues. Il combine aussi prompts système, function calling natif et sortie JSON, avec une exécution possible sous vLLM ou Transformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 30 janvier 2025 |
| Connaissances jusqu'à | 2023-10-01 |
| Multimodal | non |
| Paramètres | 24 milliards |
| Fenêtre de contexte | 32 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Arena Hard | 87,6 % | 5ᵉ / 26 | llm-stats | Auto-déclaré |
| HumanEval | 84,8 % | 36ᵉ / 65 | llm-stats | Auto-déclaré |
| MT-Bench | 83,5 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| IFEval | 82,9 % | 47ᵉ / 65 | llm-stats | Auto-déclaré |
| MATH | 70,6 % | 36ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU-Pro | 66,3 % | 95ᵉ / 125 | llm-stats | Auto-déclaré |
| Wild Bench | 52,2 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| GPQA | 45,3 % | 177ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,05 $ | 0,08 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 98 % en dessous de la moyenne des LLM similaires, et 110 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, son résultat sur GPQA le plaçait dans le top 62 % des 61 LLM de sa génération, soit une position correcte sans appartenir au groupe de tête. Son intérêt tient surtout à son rapport entre coût et possibilités techniques : ses tarifs sont 97 % inférieurs à la moyenne des LLM similaires et environ 110 fois inférieurs à ceux des modèles frontière. Son tokenizer Tekken repose sur un vocabulaire de 131 000 unités. Le modèle couvre notamment le français, l’anglais, l’allemand, l’espagnol, l’italien, le chinois, le japonais, le coréen, le portugais, le néerlandais et le polonais. Ses poids ouverts facilitent aussi l’inférence locale ou le déploiement en configuration serveur/client.
Limites et points d’attention. Environ un an après sa sortie, ses performances sont largement dépassées par les générations plus récentes et ce type de modèle est souvent retiré du catalogue actif de l’éditeur. Son classement GPQA d’époque indiquait déjà un niveau intermédiaire plutôt qu’une position de référence. Ses connaissances s’arrêtent au 1er octobre 2023, ce qui limite sa pertinence sur les événements et évolutions ultérieurs. Enfin, sa fenêtre de 32 768 tokens reste le plafond de traitement annoncé, tandis que ses 24 milliards de paramètres impliquent un modèle sensiblement plus volumineux que les petites architectures destinées aux déploiements les plus contraints.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).