DeepSeek V4 Flash

DeepSeek V4 Flash est un LLM chinois de DeepSeek, sorti le 24 avril 2026. Il associe 284 milliards de paramètres à 13 milliards de paramètres actifs et se distingue par une fenêtre de contexte de 1 048 576 tokens, adaptée aux très longs volumes de texte.

DeepSeek V4 Flash est un LLM chinois de DeepSeek, sorti le 24 avril 2026. Il associe 284 milliards de paramètres à 13 milliards de paramètres actifs et se distingue par une fenêtre de contexte de 1 048 576 tokens, adaptée aux très longs volumes de texte.

Son entraînement représente 2,5 × 10²⁴ FLOP, soit environ 693 000 heures-GPU H100 ou l’équivalent de 320 GPU H100 mobilisés pendant trois mois. À sa sortie, son classement LiveBench dans le top 100% des six LLM de sa génération ne le distinguait pas au sein de ce groupe restreint.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids▫ n.d.
Date de sortie24 avril 2026
Paramètres284 milliards
Paramètres actifs13 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index28.768ᵉ / 137
Code Index56.223ᵉ / 74
Agentic Index31.114ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)94,0 %32ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,0 %30ᵉ / 140benchable✅ Mesuré
Benchable : Hallucinations (Baseline)92,0 %84ᵉ / 146benchable✅ Mesuré
Benchable : Instruction Following (Baseline)84,0 %19ᵉ / 163benchable✅ Mesuré
LiveBench: Mathematics79,6 %6ᵉ / 7livebench✅ Mesuré
LiveBench: Reasoning70,6 %7ᵉ / 7livebench✅ Mesuré
LiveBench: Language70,1 %7ᵉ / 7livebench✅ Mesuré
LiveBench: Coding69,2 %6ᵉ / 7livebench✅ Mesuré
LiveBench: Data Analysis68,0 %6ᵉ / 7livebench✅ Mesuré
LiveBench: Global average65,5 %7ᵉ / 7livebench✅ Mesuré
LiveBench: IF63,1 %4ᵉ / 7livebench✅ Mesuré
LiveBench: Agentic Coding37,6 %7ᵉ / 7livebench✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ DeepSeek V4 Flash28.7
Nova 2.0 Pro Preview21.8

Code Index

▶ DeepSeek V4 Flash56.2
Grok Build 0.1 061651.5

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
68ᵉGLM-5V-Turbo1439
69ᵉGPT-5.11439
70ᵉDeepSeek V4 Flash1438
71ᵉGemma 4 26B-A4B1438
72ᵉDeepSeek V4 Flash1438

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
68ᵉGLM-5V-Turbo1439
69ᵉGPT-5.11439
70ᵉDeepSeek V4 Flash1438
71ᵉGemma 4 26B-A4B1438
72ᵉDeepSeek V4 Flash1438

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable11 min 37 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement2,5 × 10²⁴ FLOP
PaysChina

Notre analyse

Forces. DeepSeek V4 Flash se place dans le premier quart de l’Agentic Index et dans le premier tiers du Code Index. Ce positionnement met surtout en valeur ses aptitudes pour les tâches agentiques et le code. Ses résultats Benchable en Coding et Mathematics sont élevés, même si le plafonnement de ces épreuves réduit leur pouvoir de comparaison. La fenêtre d’environ un million de tokens constitue son autre caractéristique majeure pour le traitement de contextes très étendus.

Limites et points d’attention. L’Intelligence Index le situe en milieu de tableau. Les deux relevés Arena text le placent aux 70e et 72e rangs sur 200, avec un Elo de 1438, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Claude Fable 5 est nettement devant dans les duels humains attendus. Les scores parfaits en Reasoning, Ethics et General Knowledge sont partagés avec de nombreux modèles sur des benchmarks plafonnés, ils ne démontrent donc pas une avance particulière. DeepSeek V4 Flash reste pertinent pour le code, les tâches agentiques et les longs contextes. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).