MiniMax M3
MiniMax M3 est un LLM multimodal natif lancé par MiniMax le 1 juin 2026. Entraîné conjointement sur le texte, l’image et la vidéo, il combine environ 428 milliards de paramètres au total avec 23 milliards de paramètres actifs. MiniMax Sparse Attention porte sa fenêtre de contexte à 1 048…
MiniMax M3 est un LLM multimodal natif lancé par MiniMax le 1 juin 2026. Entraîné conjointement sur le texte, l’image et la vidéo, il combine environ 428 milliards de paramètres au total avec 23 milliards de paramètres actifs. MiniMax Sparse Attention porte sa fenêtre de contexte à 1 048 576 tokens.
Le modèle se distingue par son orientation vers le codage, les tâches agentiques et le travail collaboratif. Ses poids ouverts sous licence MIT autorisent l’usage commercial et le déploiement local. Son positionnement est très économique, avec une tarification inférieure de 85% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | MiniMax |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 1 juin 2026 |
| Multimodal | oui |
| Paramètres actifs | 23 milliards |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 44.4 | 12ᵉ / 137 |
| Code Index | 58.6 | 21ᵉ / 74 |
| Agentic Index | 35.4 | 13ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| OmniDocBench 1.5 | 91,6 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| SpreadSheetBench-v1 | 89,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| USAMO 2026 | 85,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Video-MME | 85,4 % | 6ᵉ / 17 | llm-stats | Auto-déclaré |
| VideoMMMU | 84,6 % | 7ᵉ / 26 | llm-stats | Auto-déclaré |
| BrowseComp | 83,5 % | 15ᵉ / 57 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,5 % | 10ᵉ / 102 | llm-stats | Auto-déclaré |
| MMMU-Pro | 78,1 % | 20ᵉ / 64 | llm-stats | Auto-déclaré |
| Claw-Eval | 74,5 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| MCP Atlas | 74,2 % | 13ᵉ / 30 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 70,1 % | 13ᵉ / 19 | llm-stats | Auto-déclaré |
| LiveBench | 70,0 % | 31ᵉ / 38 | llm-stats | n.d. |
| Terminal-Bench 2.1 | 66,0 % | 12ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 59,0 % | 13ᵉ / 41 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 48,3 % | 9ᵉ / 26 | llm-stats | n.d. |
| GDPval-AA | 47,7 % | 11ᵉ / 39 | llm-stats | n.d. |
| OfficeQA Pro | 45,1 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| NL2Repo | 42,1 % | 7ᵉ / 12 | llm-stats | Auto-déclaré |
| PostTrainBench | 37,1 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| APEX-Agents | 27,7 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Code | 1493 | 21ᵉ / 99 | Kimi K3 (1679) |
| Arena Image-to-Code | 1481 | 16ᵉ / 31 | Claude Fable 5 (1627) |
| Arena Text | 1445 | 60ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Document | 1435 | 20ᵉ / 32 | Claude Opus 4.6 (1508) |
| Arena Vision | 1242 | 36ᵉ / 135 | Claude Fable 5 (1318) |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,3 $ | 1,2 $ | 0,06 $ |
| fireworks | 0,3 $ | 1,2 $ | n.d. |
| minimax | 0,6 $ | 2,4 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 86 % en dessous de la moyenne des LLM similaires, et 18,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,07 $ |
| Latence moyenne par benchmark — Benchable | 22 min 26 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. MiniMax M3 se place dans le haut du classement de l’Intelligence Index et obtient également de bons rangs en Code Index et Agentic Index. À sa sortie, il figurait dans le top 9% des LLM de sa génération sur SWE-Bench Verified, ce qui confirme un positionnement solide pour l’ingénierie logicielle. Ses résultats en Coding et Reasoning sont élevés, tandis que l’Arena code le classe nettement mieux que les arènes textuelles et documentaires. Le contexte d’environ un million de tokens constitue un autre atout pour traiter de longs corpus. Trois modes de raisonnement, enabled, adaptive et disabled, permettent d’ajuster son fonctionnement. Le modèle est accessible par MiniMax Agent, MiniMax API ou en déploiement local avec plusieurs frameworks courants.
Limites et points d'attention. Les résultats sont moins homogènes hors du code. Le classement Ethics reste en retrait malgré un score Baseline élevé, et l’Arena document place MiniMax M3 dans la seconde moitié du panel. L’Arena text confirme un niveau compétitif sans atteindre les premières places. Son Elo en code demeure également inférieur à celui du leader. En contrepartie, son coût est particulièrement bas, environ 18,3 fois inférieur à celui des modèles frontière. MiniMax M3 cible ainsi surtout le codage, les agents, l’analyse de longs contextes et les déploiements commerciaux sensibles au budget.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Benchable.ai (benchable.ai).