DeepSeek-V3.2-Exp
DeepSeek-V3.2-Exp est un LLM expérimental de DeepSeek, publié le 29 septembre 2025 sous licence MIT avec des poids ouverts et un usage commercial autorisé. Fort de 685 milliards de paramètres, il accepte une fenêtre de contexte de 163 840 tokens et intègre des connaissances arrêtées au…
DeepSeek-V3.2-Exp est un LLM expérimental de DeepSeek, publié le 29 septembre 2025 sous licence MIT avec des poids ouverts et un usage commercial autorisé. Fort de 685 milliards de paramètres, il accepte une fenêtre de contexte de 163 840 tokens et intègre des connaissances arrêtées au 31 juillet 2025.
Fondé sur V3.1-Terminus, il introduit DeepSeek Sparse Attention, un mécanisme d’attention clairsemée destiné à améliorer l’efficacité de l’entraînement et de l’inférence en contexte long. Son autre caractéristique majeure est son prix très économique, inférieur de 86% à la moyenne des LLM similaires. Il peut fonctionner localement avec HuggingFace et bénéficie aussi d’une prise en charge par SGLang et vLLM.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 29 septembre 2025 |
| Multimodal | non |
| Paramètres | 685 milliards |
| Fenêtre de contexte | 163 840 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 25.4 | 78ᵉ / 137 |
| Math Index | 87.7 | 12ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| SimpleQA | 97,1 % | 1ᵉ / 45 | llm-stats | Auto-déclaré |
| AIME 2025 | 89,3 % | 46ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,0 % | 17ᵉ / 125 | llm-stats | Auto-déclaré |
| HMMT 2025 | 83,6 % | 23ᵉ / 33 | llm-stats | Auto-déclaré |
| GPQA | 79,9 % | 79ᵉ / 219 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 74,5 % | 5ᵉ / 22 | llm-stats | Auto-déclaré |
| LiveCodeBench | 74,1 % | 16ᵉ / 72 | llm-stats | Auto-déclaré |
| CodeForces | 70,7 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 67,8 % | 66ᵉ / 102 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 57,9 % | 26ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 47,9 % | 12ᵉ / 13 | llm-stats | Auto-déclaré |
| BrowseComp | 40,1 % | 51ᵉ / 57 | llm-stats | Auto-déclaré |
| Terminal-Bench | 37,7 % | 11ᵉ / 25 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 19,8 % | 57ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 94ᵉ | Qwen3-235B-A22B-Instruct-2507 | 1423 |
| 95ᵉ | DeepSeek-V3.2 (Thinking) | 1423 |
| 96ᵉ | DeepSeek-V3.2-Exp | 1423 |
| 97ᵉ | DeepSeek-R1-0528 | 1422 |
| 98ᵉ | grok-4-fast-chat | 1421 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 79ᵉ | laguna-xs.2 | 1303 |
| 80ᵉ | MiMo-V2-Flash | 1300 |
| 81ᵉ | DeepSeek-V3.2-Exp | 1288 |
| 82ᵉ | Qwen3-Coder 480B A35B Instruct | 1281 |
| 83ᵉ | Mistral Medium 3.5 | 1267 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| NovitaAI | 0,27 $ | 0,41 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 87 % en dessous de la moyenne des LLM similaires, et 20,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 7 min 59 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. DeepSeek-V3.2-Exp se distingue surtout en mathématiques, avec un Math Index situé dans le haut du classement. Ses résultats Benchable sont également solides en éthique, où il occupe la première place, ainsi qu’en connaissances générales, classification d’e-mails, mathématiques et code. À sa sortie, son classement GPQA le plaçait dans le top 17% des LLM de sa génération, ce qui le situait favorablement sur les questions scientifiques complexes. Sa longue fenêtre de contexte et DeepSeek Sparse Attention renforcent son intérêt comme plateforme d’expérimentation sur des architectures transformer plus efficaces. Son coût constitue enfin un avantage net, environ 20,4 fois inférieur à celui des modèles frontière.
Limites et points d’attention. Son Intelligence Index se situe dans la seconde moitié du classement, signe d’un niveau général moins compétitif que ses résultats mathématiques. Les évaluations Arena confirment ce contraste : le modèle reste en milieu de tableau en texte et se place près du bas du classement en code. Les scores Benchable élevés ne se traduisent donc pas systématiquement par une préférence forte dans les comparaisons directes. Son statut expérimental appelle aussi à considérer DeepSeek Sparse Attention comme une orientation de recherche plutôt que comme la garantie d’un avantage uniforme. Le modèle vise principalement les équipes recherchant un LLM open-weights très économique, doté d’un contexte long et adapté aux expérimentations locales.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).