DeepSeek V4 Flash
DeepSeek V4 Flash est un LLM chinois de DeepSeek, sorti le 24 avril 2026. Il associe 284 milliards de paramètres à 13 milliards de paramètres actifs et se distingue par une fenêtre de contexte de 1 048 576 tokens, adaptée aux très longs volumes de texte.
DeepSeek V4 Flash est un LLM chinois de DeepSeek, sorti le 24 avril 2026. Il associe 284 milliards de paramètres à 13 milliards de paramètres actifs et se distingue par une fenêtre de contexte de 1 048 576 tokens, adaptée aux très longs volumes de texte.
Son entraînement représente 2,5 × 10²⁴ FLOP, soit environ 693 000 heures-GPU H100 ou l’équivalent de 320 GPU H100 mobilisés pendant trois mois. À sa sortie, son classement LiveBench dans le top 100% des six LLM de sa génération ne le distinguait pas au sein de ce groupe restreint.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | ▫ n.d. |
| Date de sortie | 24 avril 2026 |
| Paramètres | 284 milliards |
| Paramètres actifs | 13 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 28.7 | 68ᵉ / 137 |
| Code Index | 56.2 | 23ᵉ / 74 |
| Agentic Index | 31.1 | 14ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 94,0 % | 32ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,0 % | 30ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 92,0 % | 84ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 84,0 % | 19ᵉ / 163 | benchable | ✅ Mesuré |
| LiveBench: Mathematics | 79,6 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Reasoning | 70,6 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Language | 70,1 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 69,2 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Data Analysis | 68,0 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Global average | 65,5 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: IF | 63,1 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Agentic Coding | 37,6 % | 7ᵉ / 7 | livebench | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 68ᵉ | GLM-5V-Turbo | 1439 |
| 69ᵉ | GPT-5.1 | 1439 |
| 70ᵉ | DeepSeek V4 Flash | 1438 |
| 71ᵉ | Gemma 4 26B-A4B | 1438 |
| 72ᵉ | DeepSeek V4 Flash | 1438 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 68ᵉ | GLM-5V-Turbo | 1439 |
| 69ᵉ | GPT-5.1 | 1439 |
| 70ᵉ | DeepSeek V4 Flash | 1438 |
| 71ᵉ | Gemma 4 26B-A4B | 1438 |
| 72ᵉ | DeepSeek V4 Flash | 1438 |
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 11 min 37 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 2,5 × 10²⁴ FLOP |
| Pays | China |
Notre analyse
Forces. DeepSeek V4 Flash se place dans le premier quart de l’Agentic Index et dans le premier tiers du Code Index. Ce positionnement met surtout en valeur ses aptitudes pour les tâches agentiques et le code. Ses résultats Benchable en Coding et Mathematics sont élevés, même si le plafonnement de ces épreuves réduit leur pouvoir de comparaison. La fenêtre d’environ un million de tokens constitue son autre caractéristique majeure pour le traitement de contextes très étendus.
Limites et points d’attention. L’Intelligence Index le situe en milieu de tableau. Les deux relevés Arena text le placent aux 70e et 72e rangs sur 200, avec un Elo de 1438, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant dans les duels humains attendus. Les scores parfaits en Reasoning, Ethics et General Knowledge sont partagés avec de nombreux modèles sur des benchmarks plafonnés, ils ne démontrent donc pas une avance particulière. DeepSeek V4 Flash reste pertinent pour le code, les tâches agentiques et les longs contextes. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).