MiniMax M2

MiniMax M2 est un LLM de MiniMax, éditeur chinois, sorti le 27 octobre 2025. Son architecture MoE réunit 230 milliards de paramètres, dont 10 milliards sont activés, avec une fenêtre de contexte de 1 000 000 tokens. Ce format vise à combiner grande capacité et activation plus compacte.

MiniMax M2 est un LLM de MiniMax, éditeur chinois, sorti le 27 octobre 2025. Son architecture MoE réunit 230 milliards de paramètres, dont 10 milliards sont activés, avec une fenêtre de contexte de 1 000 000 tokens. Ce format vise à combiner grande capacité et activation plus compacte.

Le modèle cible surtout le codage et les workflows agentiques : éditions multi-fichiers, cycles code-exécution-correction, réparations validées par des tests et chaînes d’outils mobilisant shell, navigateur, recherche d’information ou exécuteurs de code. Ses poids sont publiés sous licence MIT, avec usage commercial autorisé. Des accès par API, MiniMax Agent et MCP sont proposés.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurMiniMax
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie27 octobre 2025
Multimodalnon
Paramètres230 milliards
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Tau2 Telecom87,0 %16ᵉ / 34llm-statsAuto-déclaré
LiveCodeBench83,0 %5ᵉ / 72llm-statsAuto-déclaré
MMLU-Pro82,0 %38ᵉ / 125llm-statsAuto-déclaré
AIME 202578,0 %69ᵉ / 108llm-statsAuto-déclaré
GPQA78,0 %86ᵉ / 219llm-statsAuto-déclaré
Tau-bench77,2 %5ᵉ / 6llm-statsAuto-déclaré
SWE-Bench Verified69,4 %61ᵉ / 102llm-statsAuto-déclaré
AA-Index61,0 %3ᵉ / 3llm-statsAuto-déclaré
SWE-bench Multilingual56,5 %27ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh48,5 %11ᵉ / 13llm-statsAuto-déclaré
Terminal-Bench46,3 %4ᵉ / 25llm-statsAuto-déclaré
BrowseComp44,0 %49ᵉ / 57llm-statsAuto-déclaré
Multi-SWE-Bench36,2 %5ᵉ / 6llm-statsAuto-déclaré
SciCode36,0 %17ᵉ / 18llm-statsAuto-déclaré
Humanity's Last Exam12,5 %74ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
189ᵉling-flash-2.01346
190ᵉqwen-plus-01251346
191ᵉMiniMax M21346
192ᵉGPT-4o1346
193ᵉNVIDIA: Llama 3.3 Nemotron Super 49B V1.51343

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
76ᵉKimi K2 09051330
77ᵉClaude Haiku 4.51327
78ᵉMiniMax M21305
79ᵉlaguna-xs.21303
80ᵉMiMo-V2-Flash1300

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
MiniMax0,255 $1,02 $n.d.
minimax0,3 $1,2 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,1 $
Latence moyenne par benchmark — Benchable36 min 55 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Jeu de donnéesUnspecified unreleased
PaysChina

Notre analyse

Forces. MiniMax M2 obtient ses positions relatives les plus favorables en Reasoning et en Coding, où il se place dans le quart supérieur des modèles évalués. À sa sortie, son résultat sur GPQA le situait également dans le top 24% des 134 LLM de sa génération. Les scores Baseline sont élevés en connaissances générales, en éthique et en classification d’e-mails, même si les rangs associés sont moins distinctifs. Sa fenêtre de contexte d’environ 1,0 M de tokens et ses fonctions d’édition multi-fichiers soutiennent les tâches longues mêlant code, outils et corrections successives. Son tarif est très économique, 87% inférieur à la moyenne des LLM similaires et environ 21,6 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les classements Arena tempèrent les bons résultats Baseline : MiniMax M2 se situe près du bas du tableau en texte et dans le dernier quart en code. Mathematics constitue aussi son domaine Baseline le moins convaincant, avec une position sous la moyenne du classement. Les résultats en éthique, classification d’e-mails et connaissances générales affichent des pourcentages élevés, mais des rangs allant du milieu à la seconde moitié des panels, signe d’une concurrence souvent aussi performante sur ces tests. MiniMax M2 convient surtout aux workflows de codage et d’agents sensibles au coût, ainsi qu’aux traitements nécessitant un contexte très étendu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).