Magistral Small 2506

Magistral Small 2506 est un LLM de raisonnement de Mistral AI, publié le 10 juin 2025. Ancien d’environ un an, un intervalle très long à l’échelle de l’IA, il appartient désormais à une génération probablement dépassée. À sa sortie, il se classait néanmoins dans le top 29 % des LLM de sa…

Magistral Small 2506 est un LLM de raisonnement de Mistral AI, publié le 10 juin 2025. Ancien d’environ un an, un intervalle très long à l’échelle de l’IA, il appartient désormais à une génération probablement dépassée. À sa sortie, il se classait néanmoins dans le top 29 % des LLM de sa génération sur GPQA.

Ce modèle open-weights de 24 milliards de paramètres dérive de Mistral Small 3.1, enrichi par apprentissage supervisé à partir de traces de Magistral Medium puis par apprentissage par renforcement. Il produit de longues traces de raisonnement dans une section <think>, prend en charge des dizaines de langues et bénéficie d’une licence Apache 2.0 autorisant l’usage commercial.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMistral AI
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie10 juin 2025
Connaissances jusqu'à2025-06-01
Multimodalnon
Paramètres24 milliards
Fenêtre de contexte40 000 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202470,7 %39ᵉ / 52llm-statsAuto-déclaré
GPQA68,2 %125ᵉ / 219llm-statsAuto-déclaré
AIME 202562,8 %90ᵉ / 108llm-statsAuto-déclaré
LiveCodeBench51,3 %42ᵉ / 72llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Magistral Small 2506 occupait le haut du panier de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son positionnement associe raisonnement explicite, format relativement compact de 24 milliards de paramètres et couverture multilingue, notamment en français, anglais, allemand, japonais, chinois, arabe et farsi. Son écosystème d’exploitation comprend vLLM, des versions quantifiées pour llama.cpp, LM Studio, Ollama et Unsloth, ainsi que le fine-tuning avec Axolotl ou Unsloth. La licence Apache 2.0 autorise les déploiements commerciaux et la modification des poids.

Limites et points d'attention. Environ un an après sa sortie, ses performances sont largement dépassées dans un secteur qui évolue rapidement, et les modèles de cette ancienneté sont souvent retirés du catalogue de leur éditeur. Ses connaissances s’arrêtent au 1er juin 2025. La fenêtre annoncée atteint 128 000 tokens, mais une dégradation peut apparaître au-delà de 40 000 tokens, qui constituent donc la limite de contexte la plus prudente. Les longues traces de raisonnement augmentent aussi mécaniquement la quantité de texte générée avant la réponse finale.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).