DeepSeek V3.1 Terminus

DeepSeek V3.1 Terminus est un LLM à poids ouverts publié par DeepSeek le 22 septembre 2025. Il combine 37 milliards de paramètres actifs, une fenêtre de contexte de 163 840 tokens et des connaissances arrêtées au 31 mars 2025.

DeepSeek V3.1 Terminus est un LLM à poids ouverts publié par DeepSeek le 22 septembre 2025. Il combine 37 milliards de paramètres actifs, une fenêtre de contexte de 163 840 tokens et des connaissances arrêtées au 31 mars 2025.

Cette version conserve la structure de DeepSeek-V3 tout en réduisant les mélanges de texte chinois et anglais ainsi que les caractères anormaux occasionnels. Les optimisations portent aussi sur Code Agent et Search Agent, avec de nouveaux templates et outils. Son tarif très économique se situe 87% sous la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids🟢 Poids ouverts
Date de sortie22 septembre 2025
Connaissances jusqu'à2025-03-31
Multimodalnon
Paramètres actifs37 milliards
Fenêtre de contexte163 840 tokens
Modalités (entrée → sortie)text → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index21.497ᵉ / 137
Math Index53.729ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)91,0 %71ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)90,0 %74ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)90,0 %53ᵉ / 155benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ DeepSeek V3.1 Terminus21.4

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ DeepSeek V3.1 Terminus53.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
99ᵉernie-5.0-preview-10221419
100ᵉKimi K2 09051418
101ᵉDeepSeek V3.1 Terminus1418
102ᵉDeepSeek-V3.11418
103ᵉkimi-k2-0711-preview1417

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
99ᵉernie-5.0-preview-10221419
100ᵉKimi K2 09051418
101ᵉDeepSeek V3.1 Terminus1418
102ᵉDeepSeek-V3.11418
103ᵉkimi-k2-0711-preview1417

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,27 $0,95 $0,13 $

Prix en dollars US par million de tokens.

Sa tarification se situe 87 % en dessous de la moyenne des LLM similaires, et 20,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable3 min 45 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Les mathématiques constituent son meilleur axe parmi les indices disponibles : le Math Index le place dans la moitié supérieure du classement. La longue fenêtre de contexte, les poids ouverts et les optimisations de Code Agent et Search Agent renforcent son intérêt pour les traitements volumineux et les tâches agentiques. Le prix reste son avantage le plus net : DeepSeek V3.1 Terminus coûte environ 20.4 fois moins cher que les modèles frontière.

Limites et points d'attention. L'Intelligence Index le situe en retrait du classement général. Dans les deux relevés Arena text, il occupe les rangs 101 et 109 sur 200, derrière Claude Fable 5, Claude Opus 4.6 et Claude Opus 4.7. Avec environ 90 points Elo d'écart, Claude Fable 5 est nettement devant. Les scores parfaits de Benchable en Hallucinations, Ethics et General Knowledge sont plafonnés et partagés par de nombreux modèles, donc peu discriminants. Email Classification reste en retrait, tandis que Mathematics et Coding se situent autour du milieu de classement. Le modèle reste pertinent pour des expérimentations à faible coût privilégiant les poids ouverts, le contexte long ou les agents. Pour un résultat plus abouti, on lui préférera Claude Fable 5, Claude Opus 4.6 ou Claude Opus 4.7.


Sources des données : OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).