DeepSeek-V3
Sorti le 24 mars 2025, DeepSeek-V3 est déjà ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Ce LLM chinois de DeepSeek se distingue surtout par son architecture Mixture-of-Experts de 671 milliards de paramètres, dont 37 milliards sont activés par token,…
Sorti le 24 mars 2025, DeepSeek-V3 est déjà ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents. Ce LLM chinois de DeepSeek se distingue surtout par son architecture Mixture-of-Experts de 671 milliards de paramètres, dont 37 milliards sont activés par token, et par son positionnement très économique.
Son pré-entraînement sur 14.8 billions de tokens a mobilisé 3,3 × 10²⁴ FLOP, soit environ 917 000 heures-GPU H100, pour un coût estimé à 5,4 millions de dollars. Le modèle combine DeepSeekMoE, Multi-head Latent Attention, Supervised Fine-Tuning, Reinforcement Learning et distillation de capacités de raisonnement depuis DeepSeek-R1.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial restreint (recherche / non commercial) |
| Licence | MIT + Model License (Commercial use allowed) |
| Date de sortie | 25 décembre 2024 |
| Multimodal | non |
| Paramètres | 671 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DROP | 91,6 % | 1ᵉ / 29 | llm-stats | Auto-déclaré |
| CLUEWSC | 90,9 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MATH-500 | 90,2 % | 26ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-Redux | 89,1 % | 27ᵉ / 48 | llm-stats | Auto-déclaré |
| MMLU | 88,5 % | 17ᵉ / 98 | llm-stats | Auto-déclaré |
| C-Eval | 86,5 % | 12ᵉ / 18 | llm-stats | Auto-déclaré |
| IFEval | 86,1 % | 36ᵉ / 65 | llm-stats | Auto-déclaré |
| Aider-Polyglot Edit | 79,7 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| MMLU-Pro | 75,9 % | 66ᵉ / 125 | llm-stats | Auto-déclaré |
| CSimpleQA | 64,8 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| GPQA | 59,1 % | 147ᵉ / 219 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 49,6 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| LongBench v2 | 48,7 % | 13ᵉ / 15 | llm-stats | Auto-déclaré |
| CNMO 2024 | 43,2 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 42,0 % | 90ᵉ / 102 | llm-stats | Auto-déclaré |
| AIME 2024 | 39,2 % | 49ᵉ / 52 | llm-stats | Auto-déclaré |
| LiveCodeBench | 37,6 % | 50ᵉ / 72 | llm-stats | Auto-déclaré |
| SimpleQA | 24,9 % | 28ᵉ / 45 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 170ᵉ | Nemotron 3 Super (120B A12B) | 1362 |
| 171ᵉ | gemini-2.0-flash-001 | 1360 |
| 172ᵉ | DeepSeek-V3 | 1358 |
| 173ᵉ | Mistral Small 3.2 24B Instruct | 1358 |
| 174ᵉ | xAI: Grok 3 Mini Beta | 1357 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| StreamLake | 0,2002 $ | 0,8001 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Compute d'entraînement | 3,3 × 10²⁴ FLOP |
| Taille du jeu d'entraînement | 1,5 × 10¹³ |
| Coût d'entraînement estimé | ≈ 5 390 000 $ (USD 2023) |
| Matériel | NVIDIA H800 SXM5 |
| Nombre de puces | 2 048 |
| Puissance électrique | 2 818 135 W |
| Pays | China |
Notre analyse
Forces. À sa sortie, DeepSeek-V3 appartenait au top 13% des LLM de sa génération sur GPQA diamond, qui évalue des questions scientifiques de niveau doctorat. Ses résultats sur MATH level 5 restent solides et le placent dans le premier tiers des modèles recensés. Sa fenêtre de contexte de 131 072 tokens convient aux entrées volumineuses. Son principal avantage est économique : sa tarification se situe 90% sous la moyenne des LLM similaires et environ 27,5 fois sous celle des modèles frontière. L’accès passe par un service de chat, une API compatible OpenAI et des modes d’inférence locale FP8 ou BF16.
Limites et points d'attention. Les évaluations actuelles montrent un net déclassement : DeepSeek-V3 se situe près du bas du classement Arena text, reste en retrait sur OTIS Mock AIME et atteint des scores presque nuls sur FrontierMath, consacré aux mathématiques de recherche très difficiles. Ses connaissances s’arrêtent au 31 juillet 2024. Après environ un an, ses performances sont largement dépassées et cette génération est souvent retirée du catalogue de l’éditeur. L’effort d’entraînement demeure néanmoins marquant, avec l’équivalent d’environ 420 GPU H100 pendant trois mois et un coût estimé précisément à 5,4 millions de dollars. Les poids ne sont pas ouverts, malgré une licence autorisant l’usage commercial.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.