DeepSeek-V3.2 (Thinking)

DeepSeek-V3.2 (Thinking) est un LLM de DeepSeek sorti le 1 décembre 2025. Ses 685 milliards de paramètres et sa fenêtre de contexte de 131 072 tokens le positionnent comme un modèle de grande taille, conçu notamment pour le raisonnement sur des séquences longues.

DeepSeek-V3.2 (Thinking) est un LLM de DeepSeek sorti le 1 décembre 2025. Ses 685 milliards de paramètres et sa fenêtre de contexte de 131 072 tokens le positionnent comme un modèle de grande taille, conçu notamment pour le raisonnement sur des séquences longues.

Sa principale particularité technique est DeepSeek Sparse Attention, un mécanisme qui réduit la complexité du calcul d’attention en contexte long. Le modèle associe apprentissage par renforcement à grande échelle, synthèse de tâches agentiques, tool calling et « thinking with tools ». Ses poids sont ouverts sous licence MIT, avec usage commercial autorisé.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceMIT
Date de sortie1 décembre 2025
Multimodalnon
Paramètres685 milliards
Fenêtre de contexte131 072 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
AIME 202593,1 %26ᵉ / 108llm-statsAuto-déclaré
HMMT 202590,2 %17ᵉ / 33llm-statsAuto-déclaré
MMLU-Pro85,0 %17ᵉ / 125llm-statsAuto-déclaré
LiveCodeBench83,3 %3ᵉ / 72llm-statsAuto-déclaré
GPQA82,4 %64ᵉ / 219llm-statsAuto-déclaré
t2-bench80,2 %11ᵉ / 23llm-statsAuto-déclaré
CodeForces79,5 %8ᵉ / 16llm-statsAuto-déclaré
SWE-Bench Verified73,1 %45ᵉ / 102llm-statsAuto-déclaré
SWE-bench Multilingual70,2 %18ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh65,0 %6ᵉ / 13llm-statsAuto-déclaré
BrowseComp51,4 %41ᵉ / 57llm-statsAuto-déclaré
Terminal-Bench 2.046,4 %38ᵉ / 49llm-statsAuto-déclaré
Toolathlon35,2 %27ᵉ / 30llm-statsAuto-déclaré
Humanity's Last Exam25,1 %47ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
93ᵉNemotron 3 Ultra (550B A55B)1424
94ᵉQwen3-235B-A22B-Instruct-25071423
95ᵉDeepSeek-V3.2 (Thinking)1423
96ᵉDeepSeek-V3.2-Exp1423
97ᵉDeepSeek-R1-05281422

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
60ᵉGrok-4.20 Beta1381
61ᵉGPT-5.3 Codex1371
62ᵉDeepSeek-V3.2 (Thinking)1368
63ᵉGemma 4 31B1367
64ᵉQwen3.5-122B-A10B1364

Notre analyse

Forces. À sa sortie, DeepSeek-V3.2 (Thinking) figurait dans le top 15% des LLM de sa génération sur GPQA, ce qui indique un niveau compétitif en raisonnement sur des questions scientifiques complexes. Sa fenêtre de 131 072 tokens et DeepSeek Sparse Attention soutiennent le traitement de contextes longs tout en réduisant la complexité computationnelle de l’attention. Le pipeline de synthèse de tâches agentiques intègre le raisonnement à l’usage d’outils, avec un format de chat spécifique au tool calling et une capacité de « thinking with tools ». La licence MIT autorise en outre l’exploitation commerciale de ses poids ouverts.

Limites et points d'attention. Les classements Arena le placent dans la moitié basse en texte comme en code, loin des modèles en tête, malgré ses résultats plus favorables sur GPQA. Ce contraste suggère une meilleure position sur le raisonnement scientifique évalué que dans les préférences générales ou les tâches de programmation mesurées en arène. Son gabarit de 685 milliards de paramètres constitue aussi une caractéristique structurante à prendre en compte. Enfin, DeepSeek-V3.2-Speciale est une variante distincte, réservée au raisonnement profond et dépourvue de tool calling. DeepSeek-V3.2 (Thinking) cible surtout le raisonnement long et les usages agentiques avec outils.


Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai).