DeepSeek-V3.2
Publié par DeepSeek le 1 décembre 2025, DeepSeek-V3.2 est un LLM open-weights sous licence MIT, utilisable commercialement. Il réunit 685 milliards de paramètres, dont 37 milliards actifs, et une fenêtre de contexte de 163 840 tokens. Son mécanisme DeepSeek Sparse Attention réduit la…
Publié par DeepSeek le 1 décembre 2025, DeepSeek-V3.2 est un LLM open-weights sous licence MIT, utilisable commercialement. Il réunit 685 milliards de paramètres, dont 37 milliards actifs, et une fenêtre de contexte de 163 840 tokens. Son mécanisme DeepSeek Sparse Attention réduit la complexité de calcul pour les traitements à long contexte.
Le modèle associe apprentissage par renforcement, post-entraînement à grande échelle et synthèse de tâches agentiques. Il intègre le raisonnement avec appel d’outils et un rôle developer destiné aux agents de recherche. Son tarif très économique se situe 89% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 1 décembre 2025 |
| Multimodal | non |
| Paramètres | 685 milliards |
| Paramètres actifs | 37 milliards |
| Fenêtre de contexte | 163 840 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 24.7 | 82ᵉ / 137 |
| Math Index | 59.0 | 26ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| AIME 2025 | 93,1 % | 26ᵉ / 108 | llm-stats | Auto-déclaré |
| HMMT 2025 | 90,2 % | 17ᵉ / 33 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,0 % | 17ᵉ / 125 | llm-stats | Auto-déclaré |
| LiveCodeBench | 83,3 % | 3ᵉ / 72 | llm-stats | Auto-déclaré |
| GPQA | 82,4 % | 64ᵉ / 219 | llm-stats | Auto-déclaré |
| t2-bench | 80,3 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| CodeForces | 79,5 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 78,3 % | 19ᵉ / 19 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 73,1 % | 45ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 70,2 % | 18ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 65,0 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 51,4 % | 41ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 46,4 % | 38ᵉ / 49 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 40,8 % | 30ᵉ / 89 | llm-stats | Auto-déclaré |
| MCP-Mark | 38,0 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| Toolathlon | 35,2 % | 27ᵉ / 30 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 87ᵉ | gpt-5-chat-2025-08-07 | 1427 |
| 88ᵉ | GLM-4.6 | 1425 |
| 89ᵉ | DeepSeek-V3.2 | 1425 |
| 90ᵉ | deepseek-v3.2-exp-thinking | 1425 |
| 91ᵉ | Claude Opus 4 | 1424 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 72ᵉ | MiMo-V2-Flash | 1336 |
| 73ᵉ | GPT-5.2 Codex | 1334 |
| 74ᵉ | DeepSeek-V3.2 | 1332 |
| 75ᵉ | GPT-5.1 Codex | 1330 |
| 76ᵉ | Kimi K2 0905 | 1330 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| StreamLake | 0,2145 $ | 0,32175 $ | 0,02145 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 25,6 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, DeepSeek-V3.2 figurait dans le top 14% des LLM de sa génération sur GPQA diamond, consacré aux questions scientifiques de niveau doctorat. Les mathématiques constituent son principal point fort : son Math Index le place dans la moitié supérieure du classement, tandis que son résultat à OTIS Mock AIME 2024-2025 montre une solide maîtrise des problèmes d’olympiades de niveau lycée. Son coût constitue un autre avantage net, environ 25,6 fois inférieur à celui des modèles frontière. La licence MIT autorise en outre l’usage commercial des poids ouverts.
Limites et points d'attention. L’Intelligence Index situe le modèle dans la seconde moitié du classement, comme les évaluations Arena en texte et plus nettement en code. SimpleQA Verified révèle une faiblesse sur les réponses factuelles vérifiables. Les résultats diminuent aussi fortement lorsque la difficulté augmente : FrontierMath reste modeste, son Tier 4 est particulièrement faible, et les problèmes d’échecs comptent parmi ses moins bonnes évaluations. La variante DeepSeek-V3.2-Speciale cible exclusivement le raisonnement profond et ne prend pas en charge l’appel d’outils. DeepSeek-V3.2 convient surtout aux usages sensibles au coût, aux longs contextes, aux mathématiques de niveau lycée et aux scénarios agentiques avec outils.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0.