MiMo-V2.5-Pro

MiMo-V2.5-Pro est un LLM open-weights de Xiaomi, publié le 27 avril 2026 sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 1023 milliards de paramètres, dont 42 milliards actifs, et une fenêtre de contexte de 1 048 576 tokens.

MiMo-V2.5-Pro est un LLM open-weights de Xiaomi, publié le 27 avril 2026 sous licence MIT avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 1023 milliards de paramètres, dont 42 milliards actifs, et une fenêtre de contexte de 1 048 576 tokens.

Le modèle alterne Sliding Window Attention et Global Attention, intègre trois couches de Multi-Token Prediction et combine SFT, RL agentique à grande échelle et Multi-Teacher On-Policy Distillation. Son autre argument majeur est économique : sa tarification se situe 78% sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurXiaomi
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie27 avril 2026
Multimodalnon
Paramètres1023 milliards
Paramètres actifs42 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index42.217ᵉ / 137
Code Index60.217ᵉ / 74
Agentic Index29.123ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
GSM8k99,6 %1ᵉ / 47llm-statsAuto-déclaré
ARC-C97,2 %1ᵉ / 34llm-statsAuto-déclaré
MMLU-Redux92,8 %15ᵉ / 48llm-statsAuto-déclaré
C-Eval91,5 %5ᵉ / 18llm-statsAuto-déclaré
CMMLU90,2 %1ᵉ / 6llm-statsAuto-déclaré
HellaSwag89,8 %4ᵉ / 27llm-statsAuto-déclaré
MMLU89,4 %14ᵉ / 98llm-statsAuto-déclaré
BBH88,4 %2ᵉ / 12llm-statsAuto-déclaré
DROP86,3 %3ᵉ / 29llm-statsAuto-déclaré
MATH86,2 %11ᵉ / 70llm-statsAuto-déclaré
Winogrande85,6 %2ᵉ / 22llm-statsAuto-déclaré
Global-MMLU83,6 %1ᵉ / 5llm-statsAuto-déclaré
TriviaQA81,3 %3ᵉ / 18llm-statsAuto-déclaré
SWE-Bench Verified78,9 %17ᵉ / 102llm-statsAuto-déclaré
HumanEval+75,6 %7ᵉ / 10llm-statsAuto-déclaré
MBPP+74,1 %1ᵉ / 4llm-statsAuto-déclaré
TAU3-Bench72,9 %1ᵉ / 5llm-statsAuto-déclaré
MMLU-Pro68,5 %85ᵉ / 125llm-statsAuto-déclaré
Terminal-Bench 2.068,4 %13ᵉ / 49llm-statsAuto-déclaré
GPQA66,7 %129ᵉ / 219llm-statsAuto-déclaré
Claw-Eval64,0 %6ᵉ / 13llm-statsAuto-déclaré
GraphWalks62,0 %3ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Pro57,2 %21ᵉ / 41llm-statsAuto-déclaré
WildClawBench43,0 %4ᵉ / 4llm-statsAuto-déclaré
GDPval-AA42,9 %19ᵉ / 39llm-statsn.d.
Finance Agent v241,5 %15ᵉ / 26llm-statsn.d.
LiveCodeBench v639,6 %50ᵉ / 53llm-statsAuto-déclaré
Humanity's Last Exam34,0 %40ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ MiMo-V2.5-Pro42.2
DeepSeek V4 Pro40.8

Code Index

▶ MiMo-V2.5-Pro60.2

Classements Arena (Elo)

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
24ᵉGPT-5.51482
25ᵉQwen: Qwen3.6 Max Preview1480
26ᵉMiMo-V2.5-Pro1474
27ᵉKimi K2.7 Code1470
28ᵉClaude Opus 4.51466

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
33ᵉGrok-4.11466
34ᵉGrok 4.5 (high)1465
35ᵉMiMo-V2.5-Pro1465
36ᵉqwen3.5-max-preview1465
37ᵉKimi K2.61461

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
GMICloud0,348 $0,696 $0,0032 $
xiaomi0,435 $0,87 $n.d.
deepinfra1 $3 $n.d.
novita2 $6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 83 % en dessous de la moyenne des LLM similaires, et 15,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)12,13 $
Durée d'exécution — PinchBench4 h 11 min
Indice valeur/coût — PinchBench7,86
Coût moyen par benchmark — Benchable0,31 $
Latence moyenne par benchmark — Benchable26 min 39 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement6,8 × 10²⁴ FLOP
Taille du jeu d'entraînement2,7 × 10¹³
PaysChina

Notre analyse

Forces. MiMo-V2.5-Pro obtient des scores parfaits et la première place sur General Knowledge et Ethics dans Benchable. Il se classe aussi dans le haut du tableau en Coding, tandis que ses Intelligence Index et Code Index le placent tous deux au 17e rang. Sa longue fenêtre de contexte et son post-entraînement orienté vers les tâches agentiques, le génie logiciel complexe et les tâches de longue durée élargissent son champ d’utilisation. La licence MIT, les poids ouverts et les exemples de déploiement avec SGLang et vLLM facilitent par ailleurs une exploitation commerciale autonome. Le prix constitue un avantage net : il est environ 12,6 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les classements Arena sont plus modérés, avec une 24e place sur 96 en code et une 31e place sur 200 en texte. L’Agentic Index reste en retrait par rapport aux résultats en code, et les classements Benchable sur les hallucinations et la classification d’e-mails se situent loin des premières places malgré des scores bruts élevés. À sa sortie, MiMo-V2.5-Pro appartenait seulement au top 66% des LLM de sa génération sur GPQA. Il vise surtout les déploiements économiques nécessitant de longs contextes, du code et des usages agentiques.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com) · Benchable.ai (benchable.ai).