MiMo-V2-Flash

MiMo-V2-Flash est un LLM open-weights de Xiaomi, publié le 16 décembre 2025 sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 309 milliards de paramètres, dont 15 milliards sont actifs, et prend en charge une fenêtre de contexte de 262 144 tokens.

MiMo-V2-Flash est un LLM open-weights de Xiaomi, publié le 16 décembre 2025 sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 309 milliards de paramètres, dont 15 milliards sont actifs, et prend en charge une fenêtre de contexte de 262 144 tokens.

Le modèle combine Sliding Window Attention et Global Attention, un biais d’attention sink apprenable et un module Multi-Token Prediction. Son positionnement associe long contexte et prix très bas, avec une tarification inférieure de 95% à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurXiaomi
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie16 décembre 2025
Multimodalnon
Paramètres309 milliards
Paramètres actifs15 milliards
Fenêtre de contexte256 000 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index33.247ᵉ / 137

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202594,1 %21ᵉ / 108llm-statsAuto-déclaré
Arena-Hard v286,2 %1ᵉ / 16llm-statsAuto-déclaré
MMLU-Pro84,9 %22ᵉ / 125llm-statsAuto-déclaré
HMMT 202584,4 %22ᵉ / 33llm-statsAuto-déclaré
GPQA83,7 %57ᵉ / 219llm-statsAuto-déclaré
LiveCodeBench v680,6 %19ᵉ / 53llm-statsAuto-déclaré
Tau-bench80,3 %3ᵉ / 6llm-statsAuto-déclaré
SWE-Bench Verified73,4 %42ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual71,7 %15ᵉ / 34llm-statsAuto-déclaré
LongBench v260,6 %7ᵉ / 15llm-statsAuto-déclaré
BrowseComp58,3 %36ᵉ / 57llm-statsAuto-déclaré
MRCR45,7 %6ᵉ / 7llm-statsAuto-déclaré
Terminal-Bench 2.038,5 %46ᵉ / 49llm-statsAuto-déclaré
Terminal-Bench30,5 %19ᵉ / 25llm-statsAuto-déclaré
Humanity's Last Exam22,1 %52ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ MiMo-V2-Flash33.2
Qwen3.5 397B A17B32.0

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Text1393138ᵉ / 200Claude Fable 5 (1507)
Arena Text1387145ᵉ / 200Claude Fable 5 (1507)
Arena Code133672ᵉ / 99Kimi K3 (1679)
Arena Code130080ᵉ / 99Kimi K3 (1679)

Notre analyse

Forces. À sa sortie, MiMo-V2-Flash figurait dans le top 11% des LLM de sa génération sur GPQA, un résultat qui souligne ses capacités de raisonnement sur des questions scientifiques difficiles. Son Intelligence Index le place dans le premier tiers du classement couvert. Son architecture hybride alterne attention locale et globale pour traiter les longs contextes, tandis que le Multi-Token Prediction intervient pendant l’entraînement et l’inférence. Le post-entraînement combine distillation Multi-Teacher On-Policy et RL agentique. La licence MIT autorise l’exploitation commerciale des poids. Le tarif constitue un autre avantage net, environ 55 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les résultats en Arena text restent dans le dernier tiers du classement, malgré des scores Elo relativement proches selon les deux relevés concordants. Arena Code situe également le modèle dans la partie basse du tableau, loin du modèle en tête. MiMo-V2-Flash présente donc un écart marqué entre son bon positionnement sur GPQA et ses évaluations comparatives en texte et en code. Il convient surtout aux usages sensibles au coût, au long contexte et à l’accès aux poids, lorsque la priorité n’est pas d’obtenir les meilleures performances en préférences humaines ou en programmation.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).