MiMo-V2.5
MiMo-V2.5 est un LLM omnimodal de Xiaomi, publié le 22 avril 2026 sous licence MIT. Ses poids ouverts autorisent l’usage commercial. Son architecture Sparse MoE compte 311 milliards de paramètres, dont 15 milliards actifs, et accepte jusqu’à 1 048 576 tokens de contexte.
MiMo-V2.5 est un LLM omnimodal de Xiaomi, publié le 22 avril 2026 sous licence MIT. Ses poids ouverts autorisent l’usage commercial. Son architecture Sparse MoE compte 311 milliards de paramètres, dont 15 milliards actifs, et accepte jusqu’à 1 048 576 tokens de contexte.
Le modèle traite nativement le texte, les images, la vidéo et l’audio grâce à des encodeurs dédiés. Son attention hybride associe Sliding Window Attention et Global/Full Attention, tandis que des modules Multi-Token Prediction servent le décodage spéculatif. Son positionnement très économique constitue un autre trait distinctif.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Xiaomi |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 22 avril 2026 |
| Multimodal | oui |
| Paramètres | 311 milliards |
| Paramètres actifs | 15 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 37.2 | 33ᵉ / 137 |
| Code Index | 56.8 | 22ᵉ / 74 |
| Agentic Index | 23.7 | 33ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Video-MME | 87,7 % | 4ᵉ / 17 | llm-stats | Auto-déclaré |
| GraphWalks | 87,0 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| CharXiv-R | 81,0 % | 18ᵉ / 45 | llm-stats | Auto-déclaré |
| MMMU-Pro | 77,9 % | 21ᵉ / 64 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 65,8 % | 16ᵉ / 49 | llm-stats | Auto-déclaré |
| VideoHolmes | 64,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Claw-Eval | 63,2 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 56,1 % | 27ᵉ / 41 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 36,7 % | 21ᵉ / 26 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 76ᵉ | qwen3-max-preview | 1435 |
| 77ᵉ | GPT-5 | 1434 |
| 78ᵉ | MiMo-V2.5 | 1432 |
| 79ᵉ | Gemini 3.1 Flash-Lite | 1432 |
| 80ᵉ | kimi-k2.5-instant | 1431 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 41ᵉ | MiMo-V2-Pro | 1431 |
| 42ᵉ | GLM-5 | 1430 |
| 43ᵉ | MiMo-V2.5 | 1429 |
| 44ᵉ | kimi-k2.5-instant | 1408 |
| 45ᵉ | GPT-5.3 Codex | 1406 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 36ᵉ | MiniMax M3 | 1242 |
| 37ᵉ | ChatGPT-4o Latest | 1241 |
| 38ᵉ | MiMo-V2.5 | 1240 |
| 39ᵉ | Gemma 4 26B-A4B | 1240 |
| 40ᵉ | GPT-5.1 | 1238 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DigitalOcean | 0,105 $ | 0,28 $ | 0,028 $ |
| novita | 0,168 $ | 0,336 $ | n.d. |
| deepinfra | 0,4 $ | 2 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 52,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 6,23 $ |
| Durée d'exécution — PinchBench | 3 h 17 min |
| Indice valeur/coût — PinchBench | 16,88 |
| Coût moyen par benchmark — Benchable | 0,18 $ |
| Latence moyenne par benchmark — Benchable | 11 min 38 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. MiMo-V2.5 atteint la première place sur les évaluations Benchable General Knowledge et Ethics. Ses résultats en Email Classification, Reasoning et Coding le placent également dans une zone solide, tandis que le Code Index figure dans le tiers supérieur de son classement. La fenêtre d’environ un million de tokens convient au traitement de volumes importants de contenu. La prise en charge native de quatre modalités élargit son champ d’application au-delà du texte. Son coût est 95% inférieur à la moyenne des LLM similaires et environ 52,4 fois inférieur à celui des modèles frontière. Des exemples de déploiement couvrent SGLang et vLLM.
Limites et points d'attention. Les classements Arena nuancent les résultats Benchable. MiMo-V2.5 reste en milieu de tableau en texte et en vision, et se situe derrière les meilleurs modèles en code. L’Agentic Index est lui aussi médian, ce qui traduit un positionnement moins convaincant sur les tâches agentiques. Le benchmark Hallucinations affiche un score élevé, mais son classement relatif reste moins favorable que ceux obtenus en connaissance générale ou en raisonnement. MiMo-V2.5 cible ainsi les usages multimodaux, le code et les longs contextes lorsque le coût d’inférence constitue un critère prioritaire.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).