DeepSeek-V3.2

Publié par DeepSeek le 1 décembre 2025, DeepSeek-V3.2 est un LLM open-weights sous licence MIT, utilisable commercialement. Il réunit 685 milliards de paramètres, dont 37 milliards actifs, et une fenêtre de contexte de 163 840 tokens. Son mécanisme DeepSeek Sparse Attention réduit la…

Publié par DeepSeek le 1 décembre 2025, DeepSeek-V3.2 est un LLM open-weights sous licence MIT, utilisable commercialement. Il réunit 685 milliards de paramètres, dont 37 milliards actifs, et une fenêtre de contexte de 163 840 tokens. Son mécanisme DeepSeek Sparse Attention réduit la complexité de calcul pour les traitements à long contexte.

Le modèle associe apprentissage par renforcement, post-entraînement à grande échelle et synthèse de tâches agentiques. Il intègre le raisonnement avec appel d’outils et un rôle developer destiné aux agents de recherche. Son tarif très économique se situe 89% sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie1 décembre 2025
Multimodalnon
Paramètres685 milliards
Paramètres actifs37 milliards
Fenêtre de contexte163 840 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index24.782ᵉ / 137
Math Index59.026ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202593,1 %26ᵉ / 108llm-statsAuto-déclaré
HMMT 202590,2 %17ᵉ / 33llm-statsAuto-déclaré
MMLU-Pro85,0 %17ᵉ / 125llm-statsAuto-déclaré
LiveCodeBench83,3 %3ᵉ / 72llm-statsAuto-déclaré
GPQA82,4 %64ᵉ / 219llm-statsAuto-déclaré
t2-bench80,3 %9ᵉ / 23llm-statsAuto-déclaré
CodeForces79,5 %8ᵉ / 16llm-statsAuto-déclaré
IMO-AnswerBench78,3 %19ᵉ / 19llm-statsAuto-déclaré
SWE-Bench Verified73,1 %45ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual70,2 %18ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh65,0 %6ᵉ / 13llm-statsAuto-déclaré
BrowseComp51,4 %41ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench 2.046,4 %38ᵉ / 49llm-statsAuto-déclaré
Humanity's Last Exam40,8 %30ᵉ / 89llm-statsAuto-déclaré
MCP-Mark38,0 %7ᵉ / 8llm-statsAuto-déclaré
Toolathlon35,2 %27ᵉ / 30llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ DeepSeek-V3.224.7
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ DeepSeek-V3.259.0

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
87ᵉgpt-5-chat-2025-08-071427
88ᵉGLM-4.61425
89ᵉDeepSeek-V3.21425
90ᵉdeepseek-v3.2-exp-thinking1425
91ᵉClaude Opus 41424

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
72ᵉMiMo-V2-Flash1336
73ᵉGPT-5.2 Codex1334
74ᵉDeepSeek-V3.21332
75ᵉGPT-5.1 Codex1330
76ᵉKimi K2 09051330

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
StreamLake0,2145 $0,32175 $0,02145 $

Prix en dollars US par million de tokens.

Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 25,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, DeepSeek-V3.2 figurait dans le top 14% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Les mathématiques constituent son principal point fort : son Math Index le place dans la moitié supérieure du classement, tandis que son résultat à OTIS Mock AIME 2024-2025 montre une solide maîtrise des problèmes d’olympiades de niveau lycée. Son coût constitue un autre avantage net, environ 25,6 fois inférieur à celui des modèles frontière. La licence MIT autorise en outre l’usage commercial des poids ouverts.

Limites et points d'attention. L’Intelligence Index situe le modèle dans la seconde moitié du classement, comme les évaluations Arena en texte et plus nettement en code. SimpleQA Verified révèle une faiblesse sur les réponses factuelles vérifiables. Les résultats diminuent aussi fortement lorsque la difficulté augmente : FrontierMath reste modeste, son Tier 4 est particulièrement faible, et les problèmes d’échecs comptent parmi ses moins bonnes évaluations. La variante DeepSeek-V3.2-Speciale cible exclusivement le raisonnement profond et ne prend pas en charge l’appel d’outils. DeepSeek-V3.2 convient surtout aux usages sensibles au coût, aux longs contextes, aux mathématiques de niveau lycée et aux scénarios agentiques avec outils.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.