Mistral: Devstral 2 2512
Publié par Mistral AI le 9 décembre 2025, Mistral: Devstral 2 2512 est un LLM agentique spécialisé dans le génie logiciel. Ce modèle 123B, fourni en FP8 et affiné pour suivre des instructions, vise les assistants de code et les agents capables d’intervenir sur des projets logiciels.
Publié par Mistral AI le 9 décembre 2025, Mistral: Devstral 2 2512 est un LLM agentique spécialisé dans le génie logiciel. Ce modèle 123B, fourni en FP8 et affiné pour suivre des instructions, vise les assistants de code et les agents capables d’intervenir sur des projets logiciels.
Sa fenêtre de contexte de 262 144 tokens favorise l’exploration de bases de code étendues. Le modèle prend en charge le tool calling, la modification de plusieurs fichiers et l’utilisation d’outils. Son autre caractéristique majeure est un positionnement très économique, associé à des options d’utilisation par API ou en déploiement local.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Mistral AI |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 9 décembre 2025 |
| Multimodal | oui |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,file → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| PinchBench : agentique (OpenClaw, 147 tâches) | 69,4 % | 12ᵉ / 19 | pinchbench | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
PinchBench : agentique (OpenClaw, 147 tâches)
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Mistral | 0,4 $ | 2 $ | 0,04 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 4,81 $ |
| Durée d'exécution — PinchBench | 4 h 04 min |
| Indice valeur/coût — PinchBench | 36,15 |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Mistral: Devstral 2 2512 réunit plusieurs fonctions adaptées au codage agentique: exploration d’une base de code, appels d’outils, suivi d’instructions et modifications réparties entre plusieurs fichiers. Sa longue fenêtre de contexte convient au traitement de dépôts logiciels volumineux. Le déploiement local est prévu avec vLLM, SGLang, transformers, llama.cpp et Ollama, tandis que l’API Mistral offre une autre voie d’utilisation. Le tarif constitue un avantage net: il se situe 80% sous la moyenne des LLM similaires et environ 13,8 fois sous celui des modèles frontière.
Limites et points d'attention. Sur PinchBench, qui évalue le comportement agentique avec OpenClaw sur 147 tâches, le modèle atteint 69% et se classe dans la seconde moitié du panel. Ce résultat montre une efficacité réelle, mais ne le place pas parmi les références de ce benchmark. Son orientation reste centrée sur le génie logiciel, les assistants de code et les agents de développement. Il cible donc principalement le codage agentique sensible aux coûts, notamment lorsque le tool calling, le contexte étendu ou le déploiement local sont prioritaires.
Sources des données : OpenRouter (openrouter.ai) · LLM-Stats (llm-stats.com) · PinchBench (pinchbench.com).