DeepSeek-V4-Pro-Max

DeepSeek-V4-Pro-Max est le mode de raisonnement maximal de DeepSeek-V4-Pro, un LLM open-weights de DeepSeek publié le 23 avril 2026 sous licence MIT. Son positionnement associe une très grande capacité, avec 1 600 milliards de paramètres dont 49 milliards activés, à une tarification très…

DeepSeek-V4-Pro-Max est le mode de raisonnement maximal de DeepSeek-V4-Pro, un LLM open-weights de DeepSeek publié le 23 avril 2026 sous licence MIT. Son positionnement associe une très grande capacité, avec 1 600 milliards de paramètres dont 49 milliards activés, à une tarification très économique.

Ce modèle Mixture-of-Experts accepte jusqu’à 1 048 576 tokens de contexte. Son architecture hybride combine Compressed Sparse Attention, Heavily Compressed Attention et Manifold-Constrained Hyper-Connections. Le mode Think Max repose sur un prompt système spécifique et un format utilisant des balises de pensée.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie23 avril 2026
Multimodalnon
Paramètres1600 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CodeForces100,0 %1ᵉ / 16llm-statsAuto-déclaré
HMMT Feb 2695,2 %2ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench93,5 %1ᵉ / 72llm-statsAuto-déclaré
MathArena Apex90,2 %1ᵉ / 7llm-statsAuto-déclaré
GPQA90,1 %22ᵉ / 219llm-statsAuto-déclaré
IMO-AnswerBench89,8 %5ᵉ / 19llm-statsAuto-déclaré
MMLU-Pro87,5 %6ᵉ / 125llm-statsAuto-déclaré
CSimpleQA84,4 %1ᵉ / 7llm-statsAuto-déclaré
MRCR 1M83,5 %1ᵉ / 3llm-statsAuto-déclaré
BrowseComp83,4 %16ᵉ / 57llm-statsAuto-déclaré
SWE-Bench Verified80,6 %8ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual76,2 %8ᵉ / 34llm-statsAuto-déclaré
MCP Atlas73,6 %15ᵉ / 30llm-statsAuto-déclaré
LiveBench73,6 %20ᵉ / 38llm-statsn.d.
Terminal-Bench 2.067,9 %14ᵉ / 49llm-statsAuto-déclaré
SimpleQA57,9 %9ᵉ / 45llm-statsAuto-déclaré
SWE-Bench Pro55,4 %28ᵉ / 41llm-statsAuto-déclaré
Toolathlon51,8 %11ᵉ / 30llm-statsAuto-déclaré
Humanity's Last Exam48,2 %22ᵉ / 89llm-statsAuto-déclaré
GDPval-AA44,4 %17ᵉ / 39llm-statsn.d.
FrontierSWE29,0 %11ᵉ / 14llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepSeek0,435 $0,87 $0,003625 $
novita1,6 $3,2 $n.d.
deepinfra1,74 $3,48 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 79 % en dessous de la moyenne des LLM similaires, et 12,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)0,58 $
Durée d'exécution — PinchBench6 h 15 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, DeepSeek-V4-Pro-Max se classait dans le top 8% des 172 LLM de sa génération sur GPQA, ce qui le situait dans le haut du panier pour le raisonnement sur des questions scientifiques difficiles. Sa fenêtre d’environ un million de tokens favorise le traitement de contextes très longs. Les modes Non-think, Think High et Think Max permettent d’adapter l’effort de raisonnement. Son autre avantage majeur tient au coût, inférieur de 78% à la moyenne des LLM similaires et environ 12,6 fois plus bas que celui des modèles frontière. La licence MIT autorise en outre les usages commerciaux avec des poids ouverts.

Limites et points d'attention. Les résultats agentiques sont nettement moins convaincants : sur PinchBench avec OpenClaw, le modèle atteint 61% et se classe 41e sur 57, soit dans la partie basse du classement. Cette faiblesse contraste avec son positionnement plus solide sur GPQA et invite à distinguer raisonnement académique et exécution autonome de tâches. Le mode Think Max exige par ailleurs un prompt système spécial et un format à balises de pensée. Le modèle cible surtout le raisonnement, le code, les longs contextes et les tâches multilingues, avec davantage de prudence pour les scénarios agentiques.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com).