DeepSeek-V4-Flash-Max

DeepSeek-V4-Flash-Max est un LLM open-weights de DeepSeek, publié le 23 avril 2026 sous licence MIT, avec usage commercial autorisé. Son positionnement associe une fenêtre de contexte d’environ un million de tokens à une tarification très économique.

DeepSeek-V4-Flash-Max est un LLM open-weights de DeepSeek, publié le 23 avril 2026 sous licence MIT, avec usage commercial autorisé. Son positionnement associe une fenêtre de contexte d’environ un million de tokens à une tarification très économique.

Ce modèle Mixture-of-Experts compte 284 milliards de paramètres, dont 13 milliards activés. Son architecture combine Compressed Sparse Attention, Heavily Compressed Attention, Manifold-Constrained Hyper-Connections et l’optimiseur Muon. La variante Max correspond au mode de raisonnement Think Max, fondé sur un prompt système spécifique et un contenu de réflexion placé entre les balises <think> et </think>.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie23 avril 2026
Multimodalnon
Paramètres284 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CodeForces100,0 %1ᵉ / 16llm-statsAuto-déclaré
HMMT Feb 2694,8 %3ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench91,6 %2ᵉ / 72llm-statsAuto-déclaré
IMO-AnswerBench88,4 %6ᵉ / 19llm-statsAuto-déclaré
GPQA88,1 %28ᵉ / 219llm-statsAuto-déclaré
MMLU-Pro86,2 %11ᵉ / 125llm-statsAuto-déclaré
MathArena Apex85,7 %2ᵉ / 7llm-statsAuto-déclaré
SWE-Bench Verified79,0 %16ᵉ / 102llm-statsAuto-déclaré
CSimpleQA78,9 %4ᵉ / 7llm-statsAuto-déclaré
MRCR 1M78,7 %2ᵉ / 3llm-statsAuto-déclaré
SWE-bench Multilingual73,3 %12ᵉ / 34llm-statsAuto-déclaré
BrowseComp73,2 %27ᵉ / 57llm-statsAuto-déclaré
MCP Atlas69,0 %19ᵉ / 30llm-statsAuto-déclaré
Terminal-Bench 2.056,9 %27ᵉ / 49llm-statsAuto-déclaré
SWE-Bench Pro52,6 %35ᵉ / 41llm-statsAuto-déclaré
Toolathlon47,8 %18ᵉ / 30llm-statsAuto-déclaré
Humanity's Last Exam45,1 %26ᵉ / 89llm-statsAuto-déclaré
GDPval-AA40,1 %21ᵉ / 39llm-statsn.d.
SimpleQA34,1 %23ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,09 $0,18 $0,018 $
deepinfra0,1 $0,2 $n.d.
deepseek0,14 $0,28 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 61,1 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)1,44 $
Durée d'exécution — PinchBench4 h 41 min
Indice valeur/coût — PinchBench103,71

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, DeepSeek-V4-Flash-Max se situait dans le top 12% des LLM de sa génération sur GPQA. Sur PinchBench, consacré aux capacités agentiques dans OpenClaw, il atteint 82% sur 147 tâches et se classe 12e sur 57 modèles. Sa fenêtre de 1 048 576 tokens constitue un autre trait central. Le rapport entre capacités, contexte et prix est particulièrement favorable : sa tarification se situe 96% sous la moyenne des LLM similaires et environ 65,5 fois sous celle des modèles frontière. La licence MIT autorise en outre l’usage commercial des poids ouverts.

Limites et points d’attention. Malgré son bon résultat agentique, sa 12e place sur PinchBench le maintient hors du groupe de tête de ce benchmark. Ses 284 milliards de paramètres totaux représentent aussi une architecture de grande taille, même si le fonctionnement Mixture-of-Experts n’en active que 13 milliards. L’intégration du mode Think Max doit respecter son prompt système spécial et son format de réflexion balisé. Les messages suivent un encodage dédié compatible avec le format OpenAI, sans template de chat Jinja. Le modèle cible ainsi les usages agentiques, le traitement de contextes très longs et les déploiements recherchant un coût d’inférence particulièrement bas.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · PinchBench (pinchbench.com).