DeepSeek-V3.1
DeepSeek-V3.1 est un LLM open-weights de DeepSeek, publié le 10 janvier 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit surtout être replacé parmi les modèles de sa période.
DeepSeek-V3.1 est un LLM open-weights de DeepSeek, publié le 10 janvier 2025 sous licence MIT, avec usage commercial autorisé. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et doit surtout être replacé parmi les modèles de sa période.
Son architecture totalise 671 milliards de paramètres, dont 37 milliards actifs, avec des poids et activations au format FP8 UE8M0. Le modèle combine des modes « thinking » et « non-thinking », une fenêtre de contexte étendue et l’appel d’outils en mode non-thinking. Son autre caractéristique majeure reste un tarif très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | MIT |
| Date de sortie | 10 janvier 2025 |
| Multimodal | non |
| Paramètres | 671 milliards |
| Paramètres actifs | 37 milliards |
| Fenêtre de contexte | 163 840 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 21.0 | 99ᵉ / 137 |
| Math Index | 49.7 | 31ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| SimpleQA | 93,4 % | 3ᵉ / 45 | llm-stats | Auto-déclaré |
| MMLU-Redux | 91,8 % | 21ᵉ / 48 | llm-stats | Auto-déclaré |
| MMLU-Pro | 83,7 % | 29ᵉ / 125 | llm-stats | Auto-déclaré |
| GPQA | 74,9 % | 100ᵉ / 219 | llm-stats | Auto-déclaré |
| CodeForces | 69,7 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 68,4 % | 8ᵉ / 22 | llm-stats | Auto-déclaré |
| AIME 2024 | 66,3 % | 42ᵉ / 52 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 66,0 % | 70ᵉ / 102 | llm-stats | Auto-déclaré |
| LiveCodeBench | 56,4 % | 35ᵉ / 72 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 54,5 % | 29ᵉ / 34 | llm-stats | Auto-déclaré |
| AIME 2025 | 49,8 % | 94ᵉ / 108 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 49,2 % | 10ᵉ / 13 | llm-stats | Auto-déclaré |
| HMMT 2025 | 33,5 % | 32ᵉ / 33 | llm-stats | Auto-déclaré |
| Terminal-Bench | 31,3 % | 18ᵉ / 25 | llm-stats | Auto-déclaré |
| BrowseComp | 30,0 % | 54ᵉ / 57 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 15,9 % | 66ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 100ᵉ | Kimi K2 0905 | 1418 |
| 101ᵉ | DeepSeek V3.1 Terminus | 1418 |
| 102ᵉ | DeepSeek-V3.1 | 1418 |
| 103ᵉ | kimi-k2-0711-preview | 1417 |
| 104ᵉ | Qwen3.5-122B-A10B | 1417 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,25 $ | 0,95 $ | 0,13 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 22 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, DeepSeek-V3.1 se classait dans le top 9% des LLM de sa génération sur GPQA, ce qui le plaçait alors dans le haut du panier pour les questions scientifiques complexes. Ses résultats en mathématiques restent plus solides que son classement général. Le modèle propose aussi deux régimes de traitement, « thinking » et « non-thinking », ainsi que des formats destinés aux agents de code et de recherche. Sa fenêtre de contexte atteint 163 840 tokens. Son coût constitue un avantage net : sa tarification se situe 89% sous la moyenne des LLM similaires et environ 26,2 fois sous celle des modèles frontière.
Limites et points d'attention. DeepSeek-V3.1 est aujourd’hui largement dépassé par les générations plus récentes et peut ne plus être proposé directement par son éditeur. Son Intelligence Index le situe dans le bas du classement observé, tandis que son score Arena text correspond au milieu de tableau, nettement derrière le modèle en tête. Son classement mathématique demeure lui aussi intermédiaire malgré un résultat relativement meilleur que son indice général. Ses connaissances s’arrêtent au 31 mars 2025. La longueur technique déclarée de 128K diffère par ailleurs de la fenêtre de contexte de 163 840 tokens relevée dans les données comparatives.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).