DeepSeek-V4-Flash-Max
DeepSeek-V4-Flash-Max est un LLM open-weights de DeepSeek, publié le 23 avril 2026 sous licence MIT, avec usage commercial autorisé. Son positionnement associe une fenêtre de contexte d’environ un million de tokens à une tarification très économique.
DeepSeek-V4-Flash-Max est un LLM open-weights de DeepSeek, publié le 23 avril 2026 sous licence MIT, avec usage commercial autorisé. Son positionnement associe une fenêtre de contexte d’environ un million de tokens à une tarification très économique.
Ce modèle Mixture-of-Experts compte 284 milliards de paramètres, dont 13 milliards activés. Son architecture combine Compressed Sparse Attention, Heavily Compressed Attention, Manifold-Constrained Hyper-Connections et l’optimiseur Muon. La variante Max correspond au mode de raisonnement Think Max, fondé sur un prompt système spécifique et un contenu de réflexion placé entre les balises <think> et </think>.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 23 avril 2026 |
| Multimodal | non |
| Paramètres | 284 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CodeForces | 100,0 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| HMMT Feb 26 | 94,8 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench | 91,6 % | 2ᵉ / 72 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 88,4 % | 6ᵉ / 19 | llm-stats | Auto-déclaré |
| GPQA | 88,1 % | 28ᵉ / 219 | llm-stats | Auto-déclaré |
| MMLU-Pro | 86,2 % | 11ᵉ / 125 | llm-stats | Auto-déclaré |
| MathArena Apex | 85,7 % | 2ᵉ / 7 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 79,0 % | 16ᵉ / 102 | llm-stats | Auto-déclaré |
| CSimpleQA | 78,9 % | 4ᵉ / 7 | llm-stats | Auto-déclaré |
| MRCR 1M | 78,7 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 73,3 % | 12ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp | 73,2 % | 27ᵉ / 57 | llm-stats | Auto-déclaré |
| MCP Atlas | 69,0 % | 19ᵉ / 30 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 56,9 % | 27ᵉ / 49 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 52,6 % | 35ᵉ / 41 | llm-stats | Auto-déclaré |
| Toolathlon | 47,8 % | 18ᵉ / 30 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 45,1 % | 26ᵉ / 89 | llm-stats | Auto-déclaré |
| GDPval-AA | 40,1 % | 21ᵉ / 39 | llm-stats | n.d. |
| SimpleQA | 34,1 % | 23ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,09 $ | 0,18 $ | 0,018 $ |
| deepinfra | 0,1 $ | 0,2 $ | n.d. |
| deepseek | 0,14 $ | 0,28 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 61,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 1,44 $ |
| Durée d'exécution — PinchBench | 4 h 41 min |
| Indice valeur/coût — PinchBench | 103,71 |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, DeepSeek-V4-Flash-Max se situait dans le top 12% des LLM de sa génération sur GPQA. Sur PinchBench, consacré aux capacités agentiques dans OpenClaw, il atteint 82% sur 147 tâches et se classe 12e sur 57 modèles. Sa fenêtre de 1 048 576 tokens constitue un autre trait central. Le rapport entre capacités, contexte et prix est particulièrement favorable : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 65,5 fois sous celle des modèles frontière. La licence MIT autorise en outre l’usage commercial des poids ouverts.
Limites et points d’attention. Malgré son bon résultat agentique, sa 12e place sur PinchBench le maintient hors du groupe de tête de ce benchmark. Ses 284 milliards de paramètres totaux représentent aussi une architecture de grande taille, même si le fonctionnement Mixture-of-Experts n’en active que 13 milliards. L’intégration du mode Think Max doit respecter son prompt système spécial et son format de réflexion balisé. Les messages suivent un encodage dédié compatible avec le format OpenAI, sans template de chat Jinja. Le modèle cible ainsi les usages agentiques, le traitement de contextes très longs et les déploiements recherchant un coût d’inférence particulièrement bas.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com).