MiMo-V2.5

MiMo-V2.5 est un LLM omnimodal de Xiaomi, publié le 22 avril 2026 sous licence MIT. Ses poids ouverts autorisent l’usage commercial. Son architecture Sparse MoE compte 311 milliards de paramètres, dont 15 milliards actifs, et accepte jusqu’à 1 048 576 tokens de contexte.

MiMo-V2.5 est un LLM omnimodal de Xiaomi, publié le 22 avril 2026 sous licence MIT. Ses poids ouverts autorisent l’usage commercial. Son architecture Sparse MoE compte 311 milliards de paramètres, dont 15 milliards actifs, et accepte jusqu’à 1 048 576 tokens de contexte.

Le modèle traite nativement le texte, les images, la vidéo et l’audio grâce à des encodeurs dédiés. Son attention hybride associe Sliding Window Attention et Global/Full Attention, tandis que des modules Multi-Token Prediction servent le décodage spéculatif. Son positionnement très économique constitue un autre trait distinctif.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurXiaomi
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie22 avril 2026
Multimodaloui
Paramètres311 milliards
Paramètres actifs15 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index37.233ᵉ / 137
Code Index56.822ᵉ / 74
Agentic Index23.733ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Video-MME87,7 %4ᵉ / 17llm-statsAuto-déclaré
GraphWalks87,0 %2ᵉ / 3llm-statsAuto-déclaré
CharXiv-R81,0 %18ᵉ / 45llm-statsAuto-déclaré
MMMU-Pro77,9 %21ᵉ / 64llm-statsAuto-déclaré
Terminal-Bench 2.065,8 %16ᵉ / 49llm-statsAuto-déclaré
VideoHolmes64,0 %3ᵉ / 3llm-statsAuto-déclaré
Claw-Eval63,2 %7ᵉ / 13llm-statsAuto-déclaré
SWE-Bench Pro56,1 %27ᵉ / 41llm-statsAuto-déclaré
Finance Agent v236,7 %21ᵉ / 26llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ MiMo-V2.537.2
Qwen3.5 397B A17B32.0

Code Index

▶ MiMo-V2.556.8
Grok Build 0.1 061651.5

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
76ᵉqwen3-max-preview1435
77ᵉGPT-51434
78ᵉMiMo-V2.51432
79ᵉGemini 3.1 Flash-Lite1432
80ᵉkimi-k2.5-instant1431

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
41ᵉMiMo-V2-Pro1431
42ᵉGLM-51430
43ᵉMiMo-V2.51429
44ᵉkimi-k2.5-instant1408
45ᵉGPT-5.3 Codex1406

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
36ᵉMiniMax M31242
37ᵉChatGPT-4o Latest1241
38ᵉMiMo-V2.51240
39ᵉGemma 4 26B-A4B1240
40ᵉGPT-5.11238

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DigitalOcean0,105 $0,28 $0,028 $
novita0,168 $0,336 $n.d.
deepinfra0,4 $2 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 52,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)6,23 $
Durée d'exécution — PinchBench3 h 17 min
Indice valeur/coût — PinchBench16,88
Coût moyen par benchmark — Benchable0,18 $
Latence moyenne par benchmark — Benchable11 min 38 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. MiMo-V2.5 atteint la première place sur les évaluations Benchable General Knowledge et Ethics. Ses résultats en Email Classification, Reasoning et Coding le placent également dans une zone solide, tandis que le Code Index figure dans le tiers supérieur de son classement. La fenêtre d’environ un million de tokens convient au traitement de volumes importants de contenu. La prise en charge native de quatre modalités élargit son champ d’application au-delà du texte. Son coût est 95% inférieur à la moyenne des LLM similaires et environ 52,4 fois inférieur à celui des modèles frontière. Des exemples de déploiement couvrent SGLang et vLLM.

Limites et points d'attention. Les classements Arena nuancent les résultats Benchable. MiMo-V2.5 reste en milieu de tableau en texte et en vision, et se situe derrière les meilleurs modèles en code. L’Agentic Index est lui aussi médian, ce qui traduit un positionnement moins convaincant sur les tâches agentiques. Le benchmark Hallucinations affiche un score élevé, mais son classement relatif reste moins favorable que ceux obtenus en connaissance générale ou en raisonnement. MiMo-V2.5 cible ainsi les usages multimodaux, le code et les longs contextes lorsque le coût d’inférence constitue un critère prioritaire.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).