deepseek-chat-v3

deepseek-chat-v3 est un LLM édité par DeepSeek. Son évaluation Benchable couvre les hallucinations, l’éthique, les connaissances générales, la classification d’e-mails, les mathématiques et le code. Les scores bruts sont élevés dans l’ensemble de ces domaines.

deepseek-chat-v3 est un LLM édité par DeepSeek. Son évaluation Benchable couvre les hallucinations, l’éthique, les connaissances générales, la classification d’e-mails, les mathématiques et le code. Les scores bruts sont élevés dans l’ensemble de ces domaines.

Son profil se caractérise toutefois par des benchmarks souvent plafonnés et de nombreux ex æquo. Les pourcentages doivent donc être lus avec les rangs associés : plusieurs scores presque parfaits correspondent à des positions de milieu de tableau plutôt qu’à un avantage distinctif.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)92,0 %61ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)89,0 %77ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)80,0 %70ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)71,0 %47ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ deepseek-chat-v3100 %

Benchable : Ethics (Baseline)

▶ deepseek-chat-v3100 %
command-r-plus-08-202499 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable4 min 50 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. deepseek-chat-v3 obtient 100% sur Hallucinations et Ethics. Il partage toutefois la première place avec respectivement 45 et 71 autres modèles, ce qui confirme la réussite de ces tests sans départager les concurrents. Le modèle atteint aussi 100% sur General Knowledge et 98% sur Email Classification. Ses résultats restent élevés sur Mathematics et Coding, avec respectivement 92% et 89%. L’ensemble dessine un profil régulier sur les six évaluations.

Limites et points d’attention. Les classements relativisent fortement les scores bruts. Sur General Knowledge, deepseek-chat-v3 partage la 47e place sur 161 avec 24 autres modèles malgré son score maximal. Il partage aussi la 55e place sur 163 en Email Classification. Mathematics le situe à la 61e place sur 140, tandis que Coding constitue son résultat le plus en retrait, à la 77e place sur 162. Aucun de ces benchmarks ne fournit donc un avantage net. Les nombreux ex æquo et les plafonds réduisent particulièrement la portée des scores de Hallucinations, Ethics et General Knowledge.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).