deepseek-chat-v3
deepseek-chat-v3 est un LLM édité par DeepSeek. Son évaluation Benchable couvre les hallucinations, l’éthique, les connaissances générales, la classification d’e-mails, les mathématiques et le code. Les scores bruts sont élevés dans l’ensemble de ces domaines.
deepseek-chat-v3 est un LLM édité par DeepSeek. Son évaluation Benchable couvre les hallucinations, l’éthique, les connaissances générales, la classification d’e-mails, les mathématiques et le code. Les scores bruts sont élevés dans l’ensemble de ces domaines.
Son profil se caractérise toutefois par des benchmarks souvent plafonnés et de nombreux ex æquo. Les pourcentages doivent donc être lus avec les rangs associés : plusieurs scores presque parfaits correspondent à des positions de milieu de tableau plutôt qu’à un avantage distinctif.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | DeepSeek |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 92,0 % | 61ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 89,0 % | 77ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 80,0 % | 70ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 71,0 % | 47ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : Ethics (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 4 min 50 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. deepseek-chat-v3 obtient 100% sur Hallucinations et Ethics. Il partage toutefois la première place avec respectivement 45 et 71 autres modèles, ce qui confirme la réussite de ces tests sans départager les concurrents. Le modèle atteint aussi 100% sur General Knowledge et 98% sur Email Classification. Ses résultats restent élevés sur Mathematics et Coding, avec respectivement 92% et 89%. L’ensemble dessine un profil régulier sur les six évaluations.
Limites et points d’attention. Les classements relativisent fortement les scores bruts. Sur General Knowledge, deepseek-chat-v3 partage la 47e place sur 161 avec 24 autres modèles malgré son score maximal. Il partage aussi la 55e place sur 163 en Email Classification. Mathematics le situe à la 61e place sur 140, tandis que Coding constitue son résultat le plus en retrait, à la 77e place sur 162. Aucun de ces benchmarks ne fournit donc un avantage net. Les nombreux ex æquo et les plafonds réduisent particulièrement la portée des scores de Hallucinations, Ethics et General Knowledge.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).