deepseek-chat-v3.1

deepseek-chat-v3.1 est un LLM édité par DeepSeek. Son profil Benchable couvre six domaines, des questions d’éthique au code. Il se caractérise par des scores bruts élevés et réguliers dans l’ensemble de ces évaluations.

deepseek-chat-v3.1 est un LLM édité par DeepSeek. Son profil Benchable couvre six domaines, des questions d’éthique au code. Il se caractérise par des scores bruts élevés et réguliers dans l’ensemble de ces évaluations.

Cette homogénéité ne se traduit pas par une place de premier plan. Plusieurs benchmarks atteignent leur plafond et regroupent de nombreux ex aequo. Les épreuves de mathématiques et de code situent plutôt le modèle autour du milieu du classement.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)90,9 %75ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)89,0 %77ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)80,0 %70ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)70,0 %52ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ deepseek-chat-v3.1100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ deepseek-chat-v3.1100 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable12 min 30 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. deepseek-chat-v3.1 atteint le score maximal dans Ethics et General Knowledge. Ses résultats dans Hallucinations et Email Classification restent proches de ce plafond. Aucun de ses six scores bruts ne descend sous 89%, y compris en Mathematics et Coding. L’ensemble dessine un profil homogène, sans décrochage marqué entre les domaines évalués.

Limites et points d’attention. Cinq des six benchmarks sont plafonnés et peu discriminants. Dans Ethics, le modèle partage la première place avec 71 autres modèles. General Knowledge, Hallucinations et Email Classification regroupent également de nombreux ex aequo, avec 18 à 42 autres modèles au même rang. Mathematics place deepseek-chat-v3.1 au 75e rang sur 140. Coding le situe au 77e rang sur 162, à égalité avec cinq autres modèles. Ces positions de milieu de tableau relativisent les pourcentages élevés et ne font pas ressortir d’avantage comparatif net.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).