DeepSeek V3.1 Terminus
DeepSeek V3.1 Terminus est un LLM à poids ouverts publié par DeepSeek le 22 septembre 2025. Il combine 37 milliards de paramètres actifs, une fenêtre de contexte de 163 840 tokens et des connaissances arrêtées au 31 mars 2025.
DeepSeek V3.1 Terminus est un LLM à poids ouverts publié par DeepSeek le 22 septembre 2025. Il combine 37 milliards de paramètres actifs, une fenêtre de contexte de 163 840 tokens et des connaissances arrêtées au 31 mars 2025.
Cette version conserve la structure de DeepSeek-V3 tout en réduisant les mélanges de texte chinois et anglais ainsi que les caractères anormaux occasionnels. Les optimisations portent aussi sur Code Agent et Search Agent, avec de nouveaux templates et outils. Son tarif très économique se situe 87% sous la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | 🟢 Poids ouverts |
| Date de sortie | 22 septembre 2025 |
| Connaissances jusqu'à | 2025-03-31 |
| Multimodal | non |
| Paramètres actifs | 37 milliards |
| Fenêtre de contexte | 163 840 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 21.4 | 97ᵉ / 137 |
| Math Index | 53.7 | 29ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 97,0 % | 100ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 91,0 % | 71ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 90,0 % | 74ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 90,0 % | 53ᵉ / 155 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 99ᵉ | ernie-5.0-preview-1022 | 1419 |
| 100ᵉ | Kimi K2 0905 | 1418 |
| 101ᵉ | DeepSeek V3.1 Terminus | 1418 |
| 102ᵉ | DeepSeek-V3.1 | 1418 |
| 103ᵉ | kimi-k2-0711-preview | 1417 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 99ᵉ | ernie-5.0-preview-1022 | 1419 |
| 100ᵉ | Kimi K2 0905 | 1418 |
| 101ᵉ | DeepSeek V3.1 Terminus | 1418 |
| 102ᵉ | DeepSeek-V3.1 | 1418 |
| 103ᵉ | kimi-k2-0711-preview | 1417 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,27 $ | 0,95 $ | 0,13 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 87 % en dessous de la moyenne des LLM similaires, et 20,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 3 min 45 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Les mathématiques constituent son meilleur axe parmi les indices disponibles : le Math Index le place dans la moitié supérieure du classement. La longue fenêtre de contexte, les poids ouverts et les optimisations de Code Agent et Search Agent renforcent son intérêt pour les traitements volumineux et les tâches agentiques. Le prix reste son avantage le plus net : DeepSeek V3.1 Terminus coûte environ 20.4 fois moins cher que les modèles frontière.
Limites et points d'attention. L'Intelligence Index le situe en retrait du classement général. Dans les deux relevés Arena text, il occupe les rangs 101 et 109 sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Avec environ 90 points Elo d'écart, Claude Fable 5 est nettement devant. Les scores parfaits de Benchable en Hallucinations, Ethics et General Knowledge sont plafonnés et partagés par de nombreux modèles, donc peu discriminants. Email Classification reste en retrait, tandis que Mathematics et Coding se situent autour du milieu de classement. Le modèle reste pertinent pour des expérimentations à faible coût privilégiant les poids ouverts, le contexte long ou les agents. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.
Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).