DeepSeek-V3

Sorti le 24 mars 2025, DeepSeek-V3 est déjà ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Ce LLM chinois de DeepSeek se distingue surtout par son architecture Mixture-of-Experts de 671 milliards de paramètres, dont 37 milliards sont activés par token,…

Sorti le 24 mars 2025, DeepSeek-V3 est déjà ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Ce LLM chinois de DeepSeek se distingue surtout par son architecture Mixture-of-Experts de 671 milliards de paramètres, dont 37 milliards sont activés par token, et par son positionnement très économique.

Son pré-entraînement sur 14.8 billions de tokens a mobilisé 3,3 × 10²⁴ FLOP, soit environ 917 000 heures-GPU H100, pour un coût estimé à 5,4 millions de dollars. Le modèle combine DeepSeekMoE, Multi-head Latent Attention, Supervised Fine-Tuning, Reinforcement Learning et distillation de capacités de raisonnement depuis DeepSeek-R1.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
LicenceMIT + Model License (Commercial use allowed)
Date de sortie25 décembre 2024
Multimodalnon
Paramètres671 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DROP91,6 %1ᵉ / 29llm-statsAuto-déclaré
CLUEWSC90,9 %2ᵉ / 3llm-statsAuto-déclaré
MATH-50090,2 %26ᵉ / 31llm-statsAuto-déclaré
MMLU-Redux89,1 %27ᵉ / 48llm-statsAuto-déclaré
MMLU88,5 %17ᵉ / 98llm-statsAuto-déclaré
C-Eval86,5 %12ᵉ / 18llm-statsAuto-déclaré
IFEval86,1 %36ᵉ / 65llm-statsAuto-déclaré
Aider-Polyglot Edit79,7 %1ᵉ / 10llm-statsAuto-déclaré
MMLU-Pro75,9 %66ᵉ / 125llm-statsAuto-déclaré
CSimpleQA64,8 %7ᵉ / 7llm-statsAuto-déclaré
GPQA59,1 %147ᵉ / 219llm-statsAuto-déclaré
Aider-Polyglot49,6 %17ᵉ / 22llm-statsAuto-déclaré
LongBench v248,7 %13ᵉ / 15llm-statsAuto-déclaré
CNMO 202443,2 %3ᵉ / 3llm-statsAuto-déclaré
SWE-Bench Verified42,0 %90ᵉ / 102llm-statsAuto-déclaré
AIME 202439,2 %49ᵉ / 52llm-statsAuto-déclaré
LiveCodeBench37,6 %50ᵉ / 72llm-statsAuto-déclaré
SimpleQA24,9 %28ᵉ / 45llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
170ᵉNemotron 3 Super (120B A12B)1362
171ᵉgemini-2.0-flash-0011360
172ᵉDeepSeek-V31358
173ᵉMistral Small 3.2 24B Instruct1358
174ᵉxAI: Grok 3 Mini Beta1357

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
StreamLake0,2002 $0,8001 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Entraînement & empreinte

IndicateurValeur
Compute d'entraînement3,3 × 10²⁴ FLOP
Taille du jeu d'entraînement1,5 × 10¹³
Coût d'entraînement estimé≈ 5 390 000 $ (USD 2023)
MatérielNVIDIA H800 SXM5
Nombre de puces2 048
Puissance électrique2 818 135 W
PaysChina

Notre analyse

Forces. À sa sortie, DeepSeek-V3 appartenait au top 13% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ses résultats sur MATH level 5 restent solides et le placent dans le premier tiers des modèles recensés. Sa fenêtre de contexte de 131 072 tokens convient aux entrées volumineuses. Son principal avantage est économique : sa tarification se situe 90% sous la moyenne des LLM similaires et environ 27,5 fois sous celle des modèles frontière. L’accès passe par un service de chat, une API compatible OpenAI et des modes d’inférence locale FP8 ou BF16.

Limites et points d'attention. Les évaluations actuelles montrent un net déclassement : DeepSeek-V3 se situe près du bas du classement Arena text, reste en retrait sur OTIS Mock AIME et atteint des scores presque nuls sur FrontierMath, consacré aux mathématiques de recherche très difficiles. Ses connaissances s’arrêtent au 31 juillet 2024. Après environ un an, ses performances sont largement dépassées et cette génération est souvent retirée du catalogue de l’éditeur. L’effort d’entraînement demeure néanmoins marquant, avec l’équivalent d’environ 420 GPU H100 pendant trois mois et un coût estimé précisément à 5,4 millions de dollars. Les poids ne sont pas ouverts, malgré une licence autorisant l’usage commercial.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.