DeepSeek-V3.2-Exp

DeepSeek-V3.2-Exp est un LLM expérimental de DeepSeek, publié le 29 septembre 2025 sous licence MIT avec des poids ouverts et un usage commercial autorisé. Fort de 685 milliards de paramètres, il accepte une fenêtre de contexte de 163 840 tokens et intègre des connaissances arrêtées au…

DeepSeek-V3.2-Exp est un LLM expérimental de DeepSeek, publié le 29 septembre 2025 sous licence MIT avec des poids ouverts et un usage commercial autorisé. Fort de 685 milliards de paramètres, il accepte une fenêtre de contexte de 163 840 tokens et intègre des connaissances arrêtées au 31 juillet 2025.

Fondé sur V3.1-Terminus, il introduit DeepSeek Sparse Attention, un mécanisme d’attention clairsemée destiné à améliorer l’efficacité de l’entraînement et de l’inférence en contexte long. Son autre caractéristique majeure est son prix très économique, inférieur de 86% à la moyenne des LLM similaires. Il peut fonctionner localement avec HuggingFace et bénéficie aussi d’une prise en charge par SGLang et vLLM.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie29 septembre 2025
Multimodalnon
Paramètres685 milliards
Fenêtre de contexte163 840 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index25.478ᵉ / 137
Math Index87.712ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
SimpleQA97,1 %1ᵉ / 45llm-statsAuto-déclaré
AIME 202589,3 %46ᵉ / 108llm-statsAuto-déclaré
MMLU-Pro85,0 %17ᵉ / 125llm-statsAuto-déclaré
HMMT 202583,6 %23ᵉ / 33llm-statsAuto-déclaré
GPQA79,9 %79ᵉ / 219llm-statsAuto-déclaré
Aider-Polyglot74,5 %5ᵉ / 22llm-statsAuto-déclaré
LiveCodeBench74,1 %16ᵉ / 72llm-statsAuto-déclaré
CodeForces70,7 %11ᵉ / 16llm-statsAuto-déclaré
SWE-Bench Verified67,8 %66ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual57,9 %26ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh47,9 %12ᵉ / 13llm-statsAuto-déclaré
BrowseComp40,1 %51ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench37,7 %11ᵉ / 25llm-statsAuto-déclaré
Humanity's Last Exam19,8 %57ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

▶ DeepSeek-V3.2-Exp25.4
Nova 2.0 Pro Preview21.8

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ DeepSeek-V3.2-Exp87.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
94ᵉQwen3-235B-A22B-Instruct-25071423
95ᵉDeepSeek-V3.2 (Thinking)1423
96ᵉDeepSeek-V3.2-Exp1423
97ᵉDeepSeek-R1-05281422
98ᵉgrok-4-fast-chat1421

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
79ᵉlaguna-xs.21303
80ᵉMiMo-V2-Flash1300
81ᵉDeepSeek-V3.2-Exp1288
82ᵉQwen3-Coder 480B A35B Instruct1281
83ᵉMistral Medium 3.51267

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
NovitaAI0,27 $0,41 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 87 % en dessous de la moyenne des LLM similaires, et 20,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable7 min 59 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. DeepSeek-V3.2-Exp se distingue surtout en mathématiques, avec un Math Index situé dans le haut du classement. Ses résultats Benchable sont également solides en éthique, où il occupe la première place, ainsi qu’en connaissances générales, classification d’e-mails, mathématiques et code. À sa sortie, son classement GPQA le plaçait dans le top 17% des LLM de sa génération, ce qui le situait favorablement sur les questions scientifiques complexes. Sa longue fenêtre de contexte et DeepSeek Sparse Attention renforcent son intérêt comme plateforme d’expérimentation sur des architectures transformer plus efficaces. Son coût constitue enfin un avantage net, environ 20,4 fois inférieur à celui des modèles frontière.

Limites et points d’attention. Son Intelligence Index se situe dans la seconde moitié du classement, signe d’un niveau général moins compétitif que ses résultats mathématiques. Les évaluations Arena confirment ce contraste : le modèle reste en milieu de tableau en texte et se place près du bas du classement en code. Les scores Benchable élevés ne se traduisent donc pas systématiquement par une préférence forte dans les comparaisons directes. Son statut expérimental appelle aussi à considérer DeepSeek Sparse Attention comme une orientation de recherche plutôt que comme la garantie d’un avantage uniforme. Le modèle vise principalement les équipes recherchant un LLM open-weights très économique, doté d’un contexte long et adapté aux expérimentations locales.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).