MiniMax M2
MiniMax M2 est un LLM de MiniMax, éditeur chinois, sorti le 27 octobre 2025. Son architecture MoE réunit 230 milliards de paramètres, dont 10 milliards sont activés, avec une fenêtre de contexte de 1 000 000 tokens. Ce format vise à combiner grande capacité et activation plus compacte.
MiniMax M2 est un LLM de MiniMax, éditeur chinois, sorti le 27 octobre 2025. Son architecture MoE réunit 230 milliards de paramètres, dont 10 milliards sont activés, avec une fenêtre de contexte de 1 000 000 tokens. Ce format vise à combiner grande capacité et activation plus compacte.
Le modèle cible surtout le codage et les workflows agentiques : éditions multi-fichiers, cycles code-exécution-correction, réparations validées par des tests et chaînes d’outils mobilisant shell, navigateur, recherche d’information ou exécuteurs de code. Ses poids sont publiés sous licence MIT, avec usage commercial autorisé. Des accès par API, MiniMax Agent et MCP sont proposés.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | MiniMax |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 27 octobre 2025 |
| Multimodal | non |
| Paramètres | 230 milliards |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Tau2 Telecom | 87,0 % | 16ᵉ / 34 | llm-stats | Auto-déclaré |
| LiveCodeBench | 83,0 % | 5ᵉ / 72 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,0 % | 38ᵉ / 125 | llm-stats | Auto-déclaré |
| AIME 2025 | 78,0 % | 69ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 78,0 % | 86ᵉ / 219 | llm-stats | Auto-déclaré |
| Tau-bench | 77,2 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 69,4 % | 61ᵉ / 102 | llm-stats | Auto-déclaré |
| AA-Index | 61,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 56,5 % | 27ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 48,5 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| Terminal-Bench | 46,3 % | 4ᵉ / 25 | llm-stats | Auto-déclaré |
| BrowseComp | 44,0 % | 49ᵉ / 57 | llm-stats | Auto-déclaré |
| Multi-SWE-Bench | 36,2 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| SciCode | 36,0 % | 17ᵉ / 18 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 12,5 % | 74ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 189ᵉ | ling-flash-2.0 | 1346 |
| 190ᵉ | qwen-plus-0125 | 1346 |
| 191ᵉ | MiniMax M2 | 1346 |
| 192ᵉ | GPT-4o | 1346 |
| 193ᵉ | NVIDIA: Llama 3.3 Nemotron Super 49B V1.5 | 1343 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 76ᵉ | Kimi K2 0905 | 1330 |
| 77ᵉ | Claude Haiku 4.5 | 1327 |
| 78ᵉ | MiniMax M2 | 1305 |
| 79ᵉ | laguna-xs.2 | 1303 |
| 80ᵉ | MiMo-V2-Flash | 1300 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| MiniMax | 0,255 $ | 1,02 $ | n.d. |
| minimax | 0,3 $ | 1,2 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,1 $ |
| Latence moyenne par benchmark — Benchable | 36 min 55 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Jeu de données | Unspecified unreleased |
| Pays | China |
Notre analyse
Forces. MiniMax M2 obtient ses positions relatives les plus favorables en Reasoning et en Coding, où il se place dans le quart supérieur des modèles évalués. À sa sortie, son résultat sur GPQA le situait également dans le top 24% des 134 LLM de sa génération. Les scores Baseline sont élevés en connaissances générales, en éthique et en classification d’e-mails, même si les rangs associés sont moins distinctifs. Sa fenêtre de contexte d’environ 1,0 M de tokens et ses fonctions d’édition multi-fichiers soutiennent les tâches longues mêlant code, outils et corrections successives. Son tarif est très économique, 87% inférieur à la moyenne des LLM similaires et environ 21,6 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les classements Arena tempèrent les bons résultats Baseline : MiniMax M2 se situe près du bas du tableau en texte et dans le dernier quart en code. Mathematics constitue aussi son domaine Baseline le moins convaincant, avec une position sous la moyenne du classement. Les résultats en éthique, classification d’e-mails et connaissances générales affichent des pourcentages élevés, mais des rangs allant du milieu à la seconde moitié des panels, signe d’une concurrence souvent aussi performante sur ces tests. MiniMax M2 convient surtout aux workflows de codage et d’agents sensibles au coût, ainsi qu’aux traitements nécessitant un contexte très étendu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).