DeepSeek V4 Pro
DeepSeek V4 Pro est un LLM chinois de très grande taille, lancé par DeepSeek le 24 avril 2026. Il compte 1 600 milliards de paramètres, dont 49 milliards actifs, et dispose d’une fenêtre de contexte de 1 048 576 tokens.
DeepSeek V4 Pro est un LLM chinois de très grande taille, lancé par DeepSeek le 24 avril 2026. Il compte 1 600 milliards de paramètres, dont 49 milliards actifs, et dispose d’une fenêtre de contexte de 1 048 576 tokens.
À sa sortie, il figurait dans le top 9% des LLM de sa génération sur GPQA diamond. Son entraînement représente 9,7 × 10²⁴ FLOP, soit environ 2,7 millions d’heures-GPU H100, l’équivalent de 1 200 GPU H100 mobilisés pendant trois mois.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | ▫ n.d. |
| Date de sortie | 24 avril 2026 |
| Paramètres | 1600 milliards |
| Paramètres actifs | 49 milliards |
| Fenêtre de contexte | 1 048 576 tokens (≈ 1,0 M) |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 31.2 | 56ᵉ / 137 |
| Code Index | 59.4 | 18ᵉ / 74 |
| Agentic Index | 36.4 | 12ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Email Classification (Baseline) | 100,0 % | 1ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 98,5 % | 90ᵉ / 161 | benchable | ✅ Mesuré |
| Epoch: OTIS Mock AIME 2024-2025 | 96,7 % | 5ᵉ / 64 | epoch | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 96,0 % | 132ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,5 % | 16ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 94,4 % | 28ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 93,1 % | 83ᵉ / 146 | benchable | ✅ Mesuré |
| LiveBench: Mathematics | 90,7 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: GPQA diamond | 89,6 % | 8ᵉ / 85 | epoch | ✅ Mesuré |
| LiveBench: Reasoning | 82,7 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 80,0 % | 31ᵉ / 163 | benchable | ✅ Mesuré |
| LiveBench: Language | 78,1 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SWE-Bench verified | 77,6 % | 1ᵉ / 15 | epoch | ✅ Mesuré |
| LiveBench: Data Analysis | 74,5 % | 3ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Global average | 71,6 % | 4ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: Coding | 70,0 % | 5ᵉ / 7 | livebench | ✅ Mesuré |
| LiveBench: IF | 62,4 % | 6ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: SimpleQA Verified | 57,0 % | 4ᵉ / 26 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tiers-1-3-v2-Private | 45,3 % | 11ᵉ / 17 | epoch | ✅ Mesuré |
| LiveBench: Agentic Coding | 42,6 % | 5ᵉ / 7 | livebench | ✅ Mesuré |
| Epoch: Chess Puzzles | 20,0 % | 12ᵉ / 20 | epoch | ✅ Mesuré |
| Epoch: FrontierMath-Tier-4-v2-Private | 2,4 % | 15ᵉ / 18 | epoch | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
| Catégorie | Elo | Rang | En tête d'arène |
|---|---|---|---|
| Arena Code | 1459 | 30ᵉ / 99 | Kimi K3 (1679) |
| Arena Text | 1458 | 43ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Text | 1456 | 45ᵉ / 200 | Claude Fable 5 (1507) |
| Arena Code | 1447 | 33ᵉ / 99 | Kimi K3 (1679) |
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 10 min 21 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 9,7 × 10²⁴ FLOP |
| Pays | China |
Notre analyse
Forces. DeepSeek V4 Pro se distingue en mathématiques de niveau olympiade, avec une place dans le top 10 sur OTIS Mock AIME 2024-2025. Il obtient aussi un classement solide sur Coding (Baseline), dans l’Agentic Index et dans le Code Index. Dans l’Arena text, son Elo de 1458 le place 43e sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. L’écart avec le premier reste faible, DeepSeek V4 Pro demeure proche du leader en préférence humaine.
Limites et points d’attention. L’Intelligence Index situe le modèle en milieu de tableau, tandis que General Knowledge (Baseline) le classe dans la seconde moitié. Les scores maximaux en Email Classification et Reasoning sont partagés avec de nombreux concurrents sur des benchmarks plafonnés, donc peu discriminants. Ethics (Baseline) le place également en retrait, malgré un score élevé. Dans l’Arena Code, il occupe la 30e place sur 99, derrière Kimi K3, Claude Fable 5 et GPT-5.6 Sol. Le premier est nettement devant en préférence humaine. DeepSeek V4 Pro reste pertinent pour les mathématiques, le code et les tâches agentiques, mais Kimi K3, Claude Fable 5 ou GPT-5.6 Sol sont mieux classés en Arena Code.
Sources des données : Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).