MiniMax M1
Publié par MiniMax le 17 juin 2025, MiniMax M1 est un LLM de raisonnement à poids ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont aujourd’hui largement dépassées.
Publié par MiniMax le 17 juin 2025, MiniMax M1 est un LLM de raisonnement à poids ouverts. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA, dont les performances sont aujourd’hui largement dépassées.
Le modèle combine une architecture Mixture-of-Experts, une attention hybride et un mécanisme « lightning attention ». Sa fenêtre de contexte atteint 1 million de tokens. Son positionnement très économique et ses poids ouverts constituent ses principaux signes distinctifs, avec des connaissances arrêtées au 30 juin 2024.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | MiniMax |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 17 juin 2025 |
| Connaissances jusqu'à | 2024-06-30 |
| Multimodal | non |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 100,0 % | 1ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,8 % | 43ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 93,9 % | 48ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 91,0 % | 66ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 89,8 % | 94ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 87,5 % | 85ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 62,6 % | 79ᵉ / 163 | benchable | ✅ Mesuré |
| MATH-500 | 96,0 % | 15ᵉ / 31 | llm-stats | Auto-déclaré |
| AIME 2024 | 83,3 % | 19ᵉ / 52 | llm-stats | Auto-déclaré |
| MMLU-Pro | 80,6 % | 49ᵉ / 125 | llm-stats | Auto-déclaré |
| ZebraLogic | 80,1 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 128k | 76,1 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| AIME 2025 | 74,6 % | 74ᵉ / 108 | llm-stats | Auto-déclaré |
| GPQA | 69,2 % | 121ᵉ / 219 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 67,8 % | 15ᵉ / 24 | llm-stats | Auto-déclaré |
| LiveCodeBench | 62,3 % | 31ᵉ / 72 | llm-stats | Auto-déclaré |
| LongBench v2 | 61,0 % | 4ᵉ / 15 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 60,0 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| OpenAI-MRCR: 2 needle 1M | 58,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 55,6 % | 81ᵉ / 102 | llm-stats | Auto-déclaré |
| Multi-Challenge | 44,7 % | 18ᵉ / 28 | llm-stats | Auto-déclaré |
| SimpleQA | 17,9 % | 35ᵉ / 45 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 7,2 % | 82ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Email Classification (Baseline)
Benchable : General Knowledge (Baseline)
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 165ᵉ | amazon-nova-experimental-chat-11-10 | 1366 |
| 166ᵉ | Gemma 3 27B | 1366 |
| 167ᵉ | MiniMax M1 | 1364 |
| 168ᵉ | o3-mini | 1363 |
| 169ᵉ | Grok-3 Mini | 1362 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| MiniMax | 0,4 $ | 2,2 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 81 % en dessous de la moyenne des LLM similaires, et 13,8 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,23 $ |
| Latence moyenne par benchmark — Benchable | 2 h 20 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, MiniMax M1 figurait dans le top 25% des LLM de sa génération sur GPQA. Son résultat en Reasoning le plaçait dans le premier tiers du classement Benchable, tandis que Coding se situait dans la première moitié. En Email Classification, il partage la première place avec neuf autres modèles, sur un test arrivé à saturation. La fenêtre de contexte de 1 million de tokens reste notable. Le tarif se situe 81% sous la moyenne des LLM similaires et environ 13,8 fois sous celui des modèles frontière.
Limites et points d’attention. Les benchmarks plafonnés, notamment Email Classification et General Knowledge, départagent mal les modèles. MiniMax M1 apparaît en retrait sur Hallucinations et surtout dans l’Arena text, où il occupe le rang 167 sur 200 avec un Elo de 1364. Il se place derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant en duel. Son ancienneté et sa coupure des connaissances au 30 juin 2024 limitent aussi son intérêt actuel, tandis que les modèles de cette période sont souvent retirés des catalogues. Il conserve un intérêt pour l’étude d’une architecture de raisonnement à poids ouverts et à très long contexte. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).