DeepSeek V4 Pro

DeepSeek V4 Pro est un LLM chinois de très grande taille, lancé par DeepSeek le 24 avril 2026. Il compte 1 600 milliards de paramètres, dont 49 milliards actifs, et dispose d’une fenêtre de contexte de 1 048 576 tokens.

DeepSeek V4 Pro est un LLM chinois de très grande taille, lancé par DeepSeek le 24 avril 2026. Il compte 1 600 milliards de paramètres, dont 49 milliards actifs, et dispose d’une fenêtre de contexte de 1 048 576 tokens.

À sa sortie, il figurait dans le top 9% des LLM de sa génération sur GPQA diamond. Son entraînement représente 9,7 × 10²⁴ FLOP, soit environ 2,7 millions d’heures-GPU H100, l’équivalent de 1 200 GPU H100 mobilisés pendant trois mois.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids▫ n.d.
Date de sortie24 avril 2026
Paramètres1600 milliards
Paramètres actifs49 milliards
Fenêtre de contexte1 048 576 tokens (≈ 1,0 M)

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index31.256ᵉ / 137
Code Index59.418ᵉ / 74
Agentic Index36.412ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Email Classification (Baseline)100,0 %1ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)100,0 %1ᵉ / 155benchable✅ Mesuré
Benchable : General Knowledge (Baseline)98,5 %90ᵉ / 161benchable✅ Mesuré
Epoch: OTIS Mock AIME 2024-202596,7 %5ᵉ / 64epoch✅ Mesuré
Benchable : Ethics (Baseline)96,0 %132ᵉ / 159benchable✅ Mesuré
Benchable : Coding (Baseline)95,5 %16ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)94,4 %28ᵉ / 140benchable✅ Mesuré
Benchable : Hallucinations (Baseline)93,1 %83ᵉ / 146benchable✅ Mesuré
LiveBench: Mathematics90,7 %3ᵉ / 7livebench✅ Mesuré
Epoch: GPQA diamond89,6 %8ᵉ / 85epoch✅ Mesuré
LiveBench: Reasoning82,7 %3ᵉ / 7livebench✅ Mesuré
Benchable : Instruction Following (Baseline)80,0 %31ᵉ / 163benchable✅ Mesuré
LiveBench: Language78,1 %4ᵉ / 7livebench✅ Mesuré
Epoch: SWE-Bench verified77,6 %1ᵉ / 15epoch✅ Mesuré
LiveBench: Data Analysis74,5 %3ᵉ / 7livebench✅ Mesuré
LiveBench: Global average71,6 %4ᵉ / 7livebench✅ Mesuré
LiveBench: Coding70,0 %5ᵉ / 7livebench✅ Mesuré
LiveBench: IF62,4 %6ᵉ / 7livebench✅ Mesuré
Epoch: SimpleQA Verified57,0 %4ᵉ / 26epoch✅ Mesuré
Epoch: FrontierMath-Tiers-1-3-v2-Private45,3 %11ᵉ / 17epoch✅ Mesuré
LiveBench: Agentic Coding42,6 %5ᵉ / 7livebench✅ Mesuré
Epoch: Chess Puzzles20,0 %12ᵉ / 20epoch✅ Mesuré
Epoch: FrontierMath-Tier-4-v2-Private2,4 %15ᵉ / 18epoch✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Qwen3.5 397B A17B32.0
▶ DeepSeek V4 Pro31.2

Code Index

▶ DeepSeek V4 Pro59.4
Grok Build 0.1 061651.5

Classements Arena (Elo)

CatégorieEloRangEn tête d'arène
Arena Code145930ᵉ / 99Kimi K3 (1679)
Arena Text145843ᵉ / 200Claude Fable 5 (1507)
Arena Text145645ᵉ / 200Claude Fable 5 (1507)
Arena Code144733ᵉ / 99Kimi K3 (1679)

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable10 min 21 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement9,7 × 10²⁴ FLOP
PaysChina

Notre analyse

Forces. DeepSeek V4 Pro se distingue en mathématiques de niveau olympiade, avec une place dans le top 10 sur OTIS Mock AIME 2024-2025. Il obtient aussi un classement solide sur Coding (Baseline), dans l’Agentic Index et dans le Code Index. Dans l’Arena text, son Elo de 1458 le place 43e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste faible, DeepSeek V4 Pro demeure proche du leader en préférence humaine.

Limites et points d’attention. L’Intelligence Index situe le modèle en milieu de tableau, tandis que General Knowledge (Baseline) le classe dans la seconde moitié. Les scores maximaux en Email Classification et Reasoning sont partagés avec de nombreux concurrents sur des benchmarks plafonnés, donc peu discriminants. Ethics (Baseline) le place également en retrait, malgré un score élevé. Dans l’Arena Code, il occupe la 30e place sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Le premier est nettement devant en préférence humaine. DeepSeek V4 Pro reste pertinent pour les mathématiques, le code et les tâches agentiques, mais Kimi K3, Claude Fable 5 ou GPT-5.6 Sol sont mieux classés en Arena Code.


Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).