MiMo-V2-Flash
MiMo-V2-Flash est un LLM open-weights de Xiaomi, publié le 16 décembre 2025 sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 309 milliards de paramètres, dont 15 milliards sont actifs, et prend en charge une fenêtre de contexte de 262 144 tokens.
MiMo-V2-Flash est un LLM open-weights de Xiaomi, publié le 16 décembre 2025 sous licence MIT, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 309 milliards de paramètres, dont 15 milliards sont actifs, et prend en charge une fenêtre de contexte de 262 144 tokens.
Le modèle combine Sliding Window Attention et Global Attention, un biais d’attention sink apprenable et un module Multi-Token Prediction. Son positionnement associe long contexte et prix très bas, avec une tarification inférieure de 95% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Xiaomi |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 16 décembre 2025 |
| Multimodal | non |
| Paramètres | 309 milliards |
| Paramètres actifs | 15 milliards |
| Fenêtre de contexte | 256 000 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 33.2 | 47ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 94,1 % | 21ᵉ / 108 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 86,2 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Pro | 84,9 % | 22ᵉ / 125 | llm-stats | Auto-déclaré |
| HMMT 2025 | 84,4 % | 22ᵉ / 33 | llm-stats | Auto-déclaré |
| GPQA | 83,7 % | 57ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 80,6 % | 19ᵉ / 53 | llm-stats | Auto-déclaré |
| Tau-bench | 80,3 % | 3ᵉ / 6 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,4 % | 42ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 71,7 % | 15ᵉ / 34 | llm-stats | Auto-déclaré |
| LongBench v2 | 60,6 % | 7ᵉ / 15 | llm-stats | Auto-déclaré |
| BrowseComp | 58,3 % | 36ᵉ / 57 | llm-stats | Auto-déclaré |
| MRCR | 45,7 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 38,5 % | 46ᵉ / 49 | llm-stats | Auto-déclaré |
| Terminal-Bench | 30,5 % | 19ᵉ / 25 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 22,1 % | 52ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Text | 1393 | 138ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1387 | 145ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1336 | 72ᵉ / 99 | Kimi K3 (1679) |
| Arena Code | 1300 | 80ᵉ / 99 | Kimi K3 (1679) |
Notre analyse
Forces. À sa sortie, MiMo-V2-Flash figurait dans le top 11% des LLM de sa génération sur GPQA, un résultat qui souligne ses capacités de raisonnement sur des questions scientifiques difficiles. Son Intelligence Index le place dans le premier tiers du classement couvert. Son architecture hybride alterne attention locale et globale pour traiter les longs contextes, tandis que le Multi-Token Prediction intervient pendant l’entraînement et l’inférence. Le post-entraînement combine distillation Multi-Teacher On-Policy et RL agentique. La licence MIT autorise l’exploitation commerciale des poids. Le tarif constitue un autre avantage net, environ 55 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les résultats en Arena text restent dans le dernier tiers du classement, malgré des scores Elo relativement proches selon les deux relevés concordants. Arena Code situe également le modèle dans la partie basse du tableau, loin du modèle en tête. MiMo-V2-Flash présente donc un écart marqué entre son bon positionnement sur GPQA et ses évaluations comparatives en texte et en code. Il convient surtout aux usages sensibles au coût, au long contexte et à l’accès aux poids, lorsque la priorité n’est pas d’obtenir les meilleures performances en préférences humaines ou en programmation.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).