DeepSeek-V4-Pro-Max
DeepSeek-V4-Pro-Max est le mode de raisonnement maximal de DeepSeek-V4-Pro, un LLM open-weights de DeepSeek publié le 23 avril 2026 sous licence MIT. Son positionnement associe une très grande capacité, avec 1 600 milliards de paramètres dont 49 milliards activés, à une tarification très…
DeepSeek-V4-Pro-Max est le mode de raisonnement maximal de DeepSeek-V4-Pro, un LLM open-weights de DeepSeek publié le 23 avril 2026 sous licence MIT. Son positionnement associe une très grande capacité, avec 1 600 milliards de paramètres dont 49 milliards activés, à une tarification très économique.
Ce modèle Mixture-of-Experts accepte jusqu’à 1 048 576 tokens de contexte. Son architecture hybride combine Compressed Sparse Attention, Heavily Compressed Attention et Manifold-Constrained Hyper-Connections. Le mode Think Max repose sur un prompt système spécifique et un format utilisant des balises de pensée.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 23 avril 2026 |
| Multimodal | non |
| Paramètres | 1600 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CodeForces | 100,0 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| HMMT Feb 26 | 95,2 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench | 93,5 % | 1ᵉ / 72 | llm-stats | Auto-déclaré |
| MathArena Apex | 90,2 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| GPQA | 90,1 % | 22ᵉ / 219 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 89,8 % | 5ᵉ / 19 | llm-stats | Auto-déclaré |
| MMLU-Pro | 87,5 % | 6ᵉ / 125 | llm-stats | Auto-déclaré |
| CSimpleQA | 84,4 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| MRCR 1M | 83,5 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| BrowseComp | 83,4 % | 16ᵉ / 57 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 80,6 % | 8ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 76,2 % | 8ᵉ / 34 | llm-stats | Auto-déclaré |
| MCP Atlas | 73,6 % | 15ᵉ / 30 | llm-stats | Auto-déclaré |
| LiveBench | 73,6 % | 20ᵉ / 38 | llm-stats | n.d. |
| Terminal-Bench 2.0 | 67,9 % | 14ᵉ / 49 | llm-stats | Auto-déclaré |
| SimpleQA | 57,9 % | 9ᵉ / 45 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 55,4 % | 28ᵉ / 41 | llm-stats | Auto-déclaré |
| Toolathlon | 51,8 % | 11ᵉ / 30 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 48,2 % | 22ᵉ / 89 | llm-stats | Auto-déclaré |
| GDPval-AA | 44,4 % | 17ᵉ / 39 | llm-stats | n.d. |
| FrontierSWE | 29,0 % | 11ᵉ / 14 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepSeek | 0,435 $ | 0,87 $ | 0,003625 $ |
| novita | 1,6 $ | 3,2 $ | n.d. |
| deepinfra | 1,74 $ | 3,48 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 79 % en dessous de la moyenne des LLM similaires, et 12,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 0,58 $ |
| Durée d'exécution — PinchBench | 6 h 15 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, DeepSeek-V4-Pro-Max se classait dans le top 8% des 172 LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour le raisonnement sur des questions scientifiques difficiles. Sa fenêtre d’environ un million de tokens favorise le traitement de contextes très longs. Les modes Non-think, Think High et Think Max permettent d’adapter l’effort de raisonnement. Son autre avantage majeur tient au coût, inférieur de 78% à la moyenne des LLM similaires et environ 12,6 fois plus bas que celui des modèles frontière. La licence MIT autorise en outre les usages commerciaux avec des poids ouverts.
Limites et points d'attention. Les résultats agentiques sont nettement moins convaincants : sur PinchBench avec OpenClaw, le modèle atteint 61% et se classe 41e sur 57, soit dans la partie basse du classement. Cette faiblesse contraste avec son positionnement plus solide sur GPQA et invite à distinguer raisonnement académique et exécution autonome de tâches. Le mode Think Max exige par ailleurs un prompt système spécial et un format à balises de pensée. Le modèle cible surtout le raisonnement, le code, les longs contextes et les tâches multilingues, avec davantage de prudence pour les scénarios agentiques.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com).