MiMo-V2.5-Pro
MiMo-V2.5-Pro est un LLM open-weights de Xiaomi, publié le 27 avril 2026 sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 1023 milliards de paramètres, dont 42 milliards actifs, et une fenêtre de contexte de 1 048 576 tokens.
MiMo-V2.5-Pro est un LLM open-weights de Xiaomi, publié le 27 avril 2026 sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 1023 milliards de paramètres, dont 42 milliards actifs, et une fenêtre de contexte de 1 048 576 tokens.
Le modèle alterne Sliding Window Attention et Global Attention, intègre trois couches de Multi-Token Prediction et combine SFT, RL agentique à grande échelle et Multi-Teacher On-Policy Distillation. Son autre argument majeur est économique : sa tarification se situe 78% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Xiaomi |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 27 avril 2026 |
| Multimodal | non |
| Paramètres | 1023 milliards |
| Paramètres actifs | 42 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 42.2 | 17ᵉ / 137 |
| Code Index | 60.2 | 17ᵉ / 74 |
| Agentic Index | 29.1 | 23ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| GSM8k | 99,6 % | 1ᵉ / 47 | llm-stats | Auto-déclaré |
| ARC-C | 97,2 % | 1ᵉ / 34 | llm-stats | Auto-déclaré |
| MMLU-Redux | 92,8 % | 15ᵉ / 48 | llm-stats | Auto-déclaré |
| C-Eval | 91,5 % | 5ᵉ / 18 | llm-stats | Auto-déclaré |
| CMMLU | 90,2 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| HellaSwag | 89,8 % | 4ᵉ / 27 | llm-stats | Auto-déclaré |
| MMLU | 89,4 % | 14ᵉ / 98 | llm-stats | Auto-déclaré |
| BBH | 88,4 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| DROP | 86,3 % | 3ᵉ / 29 | llm-stats | Auto-déclaré |
| MATH | 86,2 % | 11ᵉ / 70 | llm-stats | Auto-déclaré |
| Winogrande | 85,6 % | 2ᵉ / 22 | llm-stats | Auto-déclaré |
| Global-MMLU | 83,6 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| TriviaQA | 81,3 % | 3ᵉ / 18 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 78,9 % | 17ᵉ / 102 | llm-stats | Auto-déclaré |
| HumanEval+ | 75,6 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| MBPP+ | 74,1 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| TAU3-Bench | 72,9 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| MMLU-Pro | 68,5 % | 85ᵉ / 125 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 68,4 % | 13ᵉ / 49 | llm-stats | Auto-déclaré |
| GPQA | 66,7 % | 129ᵉ / 219 | llm-stats | Auto-déclaré |
| Claw-Eval | 64,0 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| GraphWalks | 62,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 57,2 % | 21ᵉ / 41 | llm-stats | Auto-déclaré |
| WildClawBench | 43,0 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| GDPval-AA | 42,9 % | 19ᵉ / 39 | llm-stats | n.d. |
| Finance Agent v2 | 41,5 % | 15ᵉ / 26 | llm-stats | n.d. |
| LiveCodeBench v6 | 39,6 % | 50ᵉ / 53 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 34,0 % | 40ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 24ᵉ | GPT-5.5 | 1482 |
| 25ᵉ | Qwen: Qwen3.6 Max Preview | 1480 |
| 26ᵉ | MiMo-V2.5-Pro | 1474 |
| 27ᵉ | Kimi K2.7 Code | 1470 |
| 28ᵉ | Claude Opus 4.5 | 1466 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 33ᵉ | Grok-4.1 | 1466 |
| 34ᵉ | Grok 4.5 (high) | 1465 |
| 35ᵉ | MiMo-V2.5-Pro | 1465 |
| 36ᵉ | qwen3.5-max-preview | 1465 |
| 37ᵉ | Kimi K2.6 | 1461 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| GMICloud | 0,348 $ | 0,696 $ | 0,0032 $ |
| xiaomi | 0,435 $ | 0,87 $ | n.d. |
| deepinfra | 1 $ | 3 $ | n.d. |
| novita | 2 $ | 6 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 83 % en dessous de la moyenne des LLM similaires, et 15,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 12,13 $ |
| Durée d'exécution — PinchBench | 4 h 11 min |
| Indice valeur/coût — PinchBench | 7,86 |
| Coût moyen par benchmark — Benchable | 0,31 $ |
| Latence moyenne par benchmark — Benchable | 26 min 39 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 6,8 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 2,7 × 10¹³ |
| Pays | China |
Notre analyse
Forces. MiMo-V2.5-Pro obtient des scores parfaits et la première place sur General Knowledge et Ethics dans Benchable. Il se classe aussi dans le haut du tableau en Coding, tandis que ses Intelligence Index et Code Index le placent tous deux au 17e rang. Sa longue fenêtre de contexte et son post-entraînement orienté vers les tâches agentiques, le génie logiciel complexe et les tâches de longue durée élargissent son champ d’utilisation. La licence MIT, les poids ouverts et les exemples de déploiement avec SGLang et vLLM facilitent par ailleurs une exploitation commerciale autonome. Le prix constitue un avantage net : il est environ 12,6 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les classements Arena sont plus modérés, avec une 24e place sur 96 en code et une 31e place sur 200 en texte. L’Agentic Index reste en retrait par rapport aux résultats en code, et les classements Benchable sur les hallucinations et la classification d’e-mails se situent loin des premières places malgré des scores bruts élevés. À sa sortie, MiMo-V2.5-Pro appartenait seulement au top 66% des LLM de sa génération sur GPQA. Il vise surtout les déploiements économiques nécessitant de longs contextes, du code et des usages agentiques.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).