Magistral Small 2506
Magistral Small 2506 est un LLM de raisonnement de Mistral AI, publié le 10 juin 2025. Ancien d’environ un an, un intervalle très long à l’échelle de l’IA, il appartient désormais à une génération probablement dépassée. À sa sortie, il se classait néanmoins dans le top 29 % des LLM de sa…
Magistral Small 2506 est un LLM de raisonnement de Mistral AI, publié le 10 juin 2025. Ancien d’environ un an, un intervalle très long à l’échelle de l’IA, il appartient désormais à une génération probablement dépassée. À sa sortie, il se classait néanmoins dans le top 29 % des LLM de sa génération sur GPQA.
Ce modèle open-weights de 24 milliards de paramètres dérive de Mistral Small 3.1, enrichi par apprentissage supervisé à partir de traces de Magistral Medium puis par apprentissage par renforcement. Il produit de longues traces de raisonnement dans une section <think>, prend en charge des dizaines de langues et bénéficie d’une licence Apache 2.0 autorisant l’usage commercial.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 10 juin 2025 |
| Connaissances jusqu'à | 2025-06-01 |
| Multimodal | non |
| Paramètres | 24 milliards |
| Fenêtre de contexte | 40 000 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 70,7 % | 39ᵉ / 52 | llm-stats | Auto-déclaré |
| GPQA | 68,2 % | 125ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2025 | 62,8 % | 90ᵉ / 108 | llm-stats | Auto-déclaré |
| LiveCodeBench | 51,3 % | 42ᵉ / 72 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Magistral Small 2506 occupait le haut du panier de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son positionnement associe raisonnement explicite, format relativement compact de 24 milliards de paramètres et couverture multilingue, notamment en français, anglais, allemand, japonais, chinois, arabe et farsi. Son écosystème d’exploitation comprend vLLM, des versions quantifiées pour llama.cpp, LM Studio, Ollama et Unsloth, ainsi que le fine-tuning avec Axolotl ou Unsloth. La licence Apache 2.0 autorise les déploiements commerciaux et la modification des poids.
Limites et points d'attention. Environ un an après sa sortie, ses performances sont largement dépassées dans un secteur qui évolue rapidement, et les modèles de cette ancienneté sont souvent retirés du catalogue de leur éditeur. Ses connaissances s’arrêtent au 1er juin 2025. La fenêtre annoncée atteint 128 000 tokens, mais une dégradation peut apparaître au-delà de 40 000 tokens, qui constituent donc la limite de contexte la plus prudente. Les longues traces de raisonnement augmentent aussi mécaniquement la quantité de texte générée avant la réponse finale.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).