Min istral 3 (3B Reasoning 2512)
Min istral 3 (3B Reasoning 2512) est un LLM compact de Mistral AI, sorti le 4 décembre 2025. Cette version post-entraînée pour le raisonnement combine un modèle de langage de 3,4 milliards de paramètres et un encodeur visuel de 0,4 milliard, afin de traiter conjointement le texte et les…
Min istral 3 (3B Reasoning 2512) est un LLM compact de Mistral AI, sorti le 4 décembre 2025. Cette version post-entraînée pour le raisonnement combine un modèle de langage de 3,4 milliards de paramètres et un encodeur visuel de 0,4 milliard, afin de traiter conjointement le texte et les images.
Le modèle se distingue par le raisonnement multi-étapes, l’appel natif de fonctions, la production de JSON et une fenêtre de contexte de 131 100 tokens. Multilingue, il couvre notamment le français, l’anglais, le chinois et l’arabe. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial et le déploiement local ou en périphérie.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 4 décembre 2025 |
| Multimodal | oui |
| Paramètres | 3 milliards |
| Fenêtre de contexte | 131 100 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2024 | 77,5 % | 31ᵉ / 52 | llm-stats | Auto-déclaré |
| AIME 2025 | 72,1 % | 78ᵉ / 108 | llm-stats | Auto-déclaré |
| LiveCodeBench | 54,8 % | 37ᵉ / 72 | llm-stats | Auto-déclaré |
| GPQA | 53,4 % | 155ᵉ / 219 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Min istral 3 (3B Reasoning 2512) réunit dans un format compact plusieurs fonctions utiles aux applications structurées : analyse d’images, raisonnement multi-étapes, appels de fonctions et réponses en JSON. Sa fenêtre de contexte étendue convient au traitement de longs contenus. La prise en charge de dizaines de langues élargit son champ d’utilisation au-delà de l’anglais. Le modèle peut être exploité localement avec vLLM ou transformers, tandis que la licence Apache 2.0 autorise son intégration dans des produits commerciaux et l’adaptation de ses poids.
Limites et points d’attention. À sa sortie, le modèle se classait dans le top 65% des 147 LLM de sa génération sur GPQA, un benchmark centré sur des questions scientifiques difficiles. Ce positionnement le place au-dessus de la partie basse du classement, mais pas parmi les modèles les plus performants de son époque sur cette évaluation. Cette mesure repose sur une seule source de données concordante, ce qui limite la portée de la comparaison. Le modèle cible surtout les déploiements locaux, multilingues et multimodaux nécessitant des sorties structurées, plutôt que la recherche du meilleur niveau disponible sur les tâches scientifiques complexes.
Sources des données : LLM-Stats (llm-stats.com).