deepseek-chat-v3.1
deepseek-chat-v3.1 est un LLM édité par DeepSeek. Son profil Benchable couvre six domaines, des questions d’éthique au code. Il se caractérise par des scores bruts élevés et réguliers dans l’ensemble de ces évaluations.
deepseek-chat-v3.1 est un LLM édité par DeepSeek. Son profil Benchable couvre six domaines, des questions d’éthique au code. Il se caractérise par des scores bruts élevés et réguliers dans l’ensemble de ces évaluations.
Cette homogénéité ne se traduit pas par une place de premier plan. Plusieurs benchmarks atteignent leur plafond et regroupent de nombreux ex aequo. Les épreuves de mathématiques et de code situent plutôt le modèle autour du milieu du classement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 98,0 % | 47ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 90,9 % | 75ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 89,0 % | 77ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 80,0 % | 70ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 70,0 % | 52ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : General Knowledge (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 12 min 30 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. deepseek-chat-v3.1 atteint le score maximal dans Ethics et General Knowledge. Ses résultats dans Hallucinations et Email Classification restent proches de ce plafond. Aucun de ses six scores bruts ne descend sous 89%, y compris en Mathematics et Coding. L’ensemble dessine un profil homogène, sans décrochage marqué entre les domaines évalués.
Limites et points d’attention. Cinq des six benchmarks sont plafonnés et peu discriminants. Dans Ethics, le modèle partage la première place avec 71 autres modèles. General Knowledge, Hallucinations et Email Classification regroupent également de nombreux ex aequo, avec 18 à 42 autres modèles au même rang. Mathematics place deepseek-chat-v3.1 au 75e rang sur 140. Coding le situe au 77e rang sur 162, à égalité avec cinq autres modèles. Ces positions de milieu de tableau relativisent les pourcentages élevés et ne font pas ressortir d’avantage comparatif net.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).