DeepSeek-V3.2 (Thinking)
DeepSeek-V3.2 (Thinking) est un LLM de DeepSeek sorti le 1 décembre 2025. Ses 685 milliards de paramètres et sa fenêtre de contexte de 131 072 tokens le positionnent comme un modèle de grande taille, conçu notamment pour le raisonnement sur des séquences longues.
DeepSeek-V3.2 (Thinking) est un LLM de DeepSeek sorti le 1 décembre 2025. Ses 685 milliards de paramètres et sa fenêtre de contexte de 131 072 tokens le positionnent comme un modèle de grande taille, conçu notamment pour le raisonnement sur des séquences longues.
Sa principale particularité technique est DeepSeek Sparse Attention, un mécanisme qui réduit la complexité du calcul d’attention en contexte long. Le modèle associe apprentissage par renforcement à grande échelle, synthèse de tâches agentiques, tool calling et « thinking with tools ». Ses poids sont ouverts sous licence MIT, avec usage commercial autorisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 1 décembre 2025 |
| Multimodal | non |
| Paramètres | 685 milliards |
| Fenêtre de contexte | 131 072 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 93,1 % | 26ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 90,2 % | 17ᵉ / 33 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,0 % | 17ᵉ / 125 | llm-stats | Auto-déclaré |
| LiveCodeBench | 83,3 % | 3ᵉ / 72 | llm-stats | Auto-déclaré |
| GPQA | 82,4 % | 64ᵉ / 219 | llm-stats | Auto-déclaré |
| t2-bench | 80,2 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| CodeForces | 79,5 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,1 % | 45ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 70,2 % | 18ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 65,0 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 51,4 % | 41ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 46,4 % | 38ᵉ / 49 | llm-stats | Auto-déclaré |
| Toolathlon | 35,2 % | 27ᵉ / 30 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 25,1 % | 47ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 93ᵉ | Nemotron 3 Ultra (550B A55B) | 1424 |
| 94ᵉ | Qwen3-235B-A22B-Instruct-2507 | 1423 |
| 95ᵉ | DeepSeek-V3.2 (Thinking) | 1423 |
| 96ᵉ | DeepSeek-V3.2-Exp | 1423 |
| 97ᵉ | DeepSeek-R1-0528 | 1422 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 60ᵉ | Grok-4.20 Beta | 1381 |
| 61ᵉ | GPT-5.3 Codex | 1371 |
| 62ᵉ | DeepSeek-V3.2 (Thinking) | 1368 |
| 63ᵉ | Gemma 4 31B | 1367 |
| 64ᵉ | Qwen3.5-122B-A10B | 1364 |
Notre analyse
Forces. À sa sortie, DeepSeek-V3.2 (Thinking) figurait dans le top 15% des LLM de sa génération sur GPQA, ce qui indique un niveau compétitif en raisonnement sur des questions scientifiques complexes. Sa fenêtre de 131 072 tokens et DeepSeek Sparse Attention soutiennent le traitement de contextes longs tout en réduisant la complexité computationnelle de l’attention. Le pipeline de synthèse de tâches agentiques intègre le raisonnement à l’usage d’outils, avec un format de chat spécifique au tool calling et une capacité de « thinking with tools ». La licence MIT autorise en outre l’exploitation commerciale de ses poids ouverts.
Limites et points d'attention. Les classements Arena le placent dans la moitié basse en texte comme en code, loin des modèles en tête, malgré ses résultats plus favorables sur GPQA. Ce contraste suggère une meilleure position sur le raisonnement scientifique évalué que dans les préférences générales ou les tâches de programmation mesurées en arène. Son gabarit de 685 milliards de paramètres constitue aussi une caractéristique structurante à prendre en compte. Enfin, DeepSeek-V3.2-Speciale est une variante distincte, réservée au raisonnement profond et dépourvue de tool calling. DeepSeek-V3.2 (Thinking) cible surtout le raisonnement long et les usages agentiques avec outils.
Sources des données : LLM-Stats (llm-stats.com) · Arena.ai (arena.ai).