DeepSeek-V4-Flash-0731
DeepSeek-V4-Flash-0731 est un LLM de 304 milliards de paramètres publié par DeepSeek le 31 juillet 2026. Ses poids sont ouverts sous licence MIT et l’usage commercial est autorisé. Il associe une fenêtre de contexte d’environ un million de tokens à un positionnement tarifaire très…
DeepSeek-V4-Flash-0731 est un LLM de 304 milliards de paramètres publié par DeepSeek le 31 juillet 2026. Ses poids sont ouverts sous licence MIT et l’usage commercial est autorisé. Il associe une fenêtre de contexte d’environ un million de tokens à un positionnement tarifaire très économique.
Le modèle reprend la structure de DeepSeek-V4-Flash-DSpark et intègre le décodage spéculatif DSpark, activable avec vLLM ou SGLang. Trois niveaux d’effort, « low », « high » et « max », règlent la délibération avant la réponse. L’intégration repose sur des scripts Python qui convertissent les messages au format compatible OpenAI et analysent les sorties textuelles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 31 juillet 2026 |
| Multimodal | non |
| Paramètres | 304 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Epoch: OTIS Mock AIME 2024-2025 | 94,4 % | 22ᵉ / 122 | epoch | ✅ Mesuré |
| Epoch: GPQA diamond | 91,0 % | 19ᵉ / 143 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 57,5 % | 23ᵉ / 42 | epoch | ✅ Mesuré |
| Epoch: SimpleQA Verified | 34,7 % | 42ᵉ / 63 | epoch | ✅ Mesuré |
| Epoch: Chess Puzzles | 33,0 % | 20ᵉ / 65 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 24,4 % | 24ᵉ / 43 | epoch | ✅ Mesuré |
| Terminal-Bench 2.1 | 82,7 % | 8ᵉ / 17 | llm-stats | Auto-déclaré |
| CyberGym | 76,7 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| Toolathlon | 70,3 % | 3ᵉ / 31 | llm-stats | Auto-déclaré |
| DeepSWE | 54,4 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| NL2Repo | 54,2 % | 2ᵉ / 14 | llm-stats | Auto-déclaré |
| Agents' Last Exam | 25,2 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| AutomationBench | 25,1 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Epoch: OTIS Mock AIME 2024-2025
Epoch: GPQA diamond
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Morph | 0,083 $ | 0,167 $ | 0,0027 $ |
| deepinfra | 0,09 $ | 0,18 $ | n.d. |
| fireworks | 0,14 $ | 0,28 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 96 % en dessous de la moyenne des LLM similaires, et 66,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, DeepSeek-V4-Flash-0731 figurait dans le top 22% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Ses résultats sur GPQA diamond et OTIS Mock AIME 2024-2025 témoignent d’une bonne maîtrise des sciences et des mathématiques de niveau lycée. Ces deux benchmarks sont toutefois plafonnés et ne départagent plus finement les modèles proches. La fenêtre de 1 048 576 tokens constitue un autre trait distinctif. Le prix se situe 96% sous la moyenne des LLM similaires et environ 66.3 fois sous celui des modèles frontière.
Limites et points d'attention. Les performances deviennent plus irrégulières sur les évaluations les plus exigeantes. Le modèle se place en milieu de tableau sur FrontierMath-Tiers-1-3-v2-Private et FrontierMath-Tier-4-v2-Private, qui mesurent des mathématiques de recherche très difficiles. Il est aussi en retrait sur SimpleQA Verified, avec une 42e place sur 63 en questions factuelles vérifiables. Son résultat aux problèmes d’échecs reste intermédiaire. DeepSeek-V4-Flash-0731 convient surtout aux projets qui privilégient une très longue fenêtre de contexte, des poids ouverts et un faible coût d’inférence.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Epoch AI (epoch.ai), CC-BY-4.0.