deepseek-chat-v3-0324

deepseek-chat-v3-0324 est un LLM édité par DeepSeek. Son profil couvre des tâches variées, de la connaissance générale aux mathématiques et au code, ainsi que la classification d’e-mails, l’éthique et les hallucinations.

deepseek-chat-v3-0324 est un LLM édité par DeepSeek. Son profil couvre des tâches variées, de la connaissance générale aux mathématiques et au code, ainsi que la classification d’e-mails, l’éthique et les hallucinations.

Ses scores bruts sont élevés dans les six benchmarks Benchable disponibles. Les classements racontent toutefois une histoire plus contrastée selon les tâches. Tous ces tests sont plafonnés et départagent mal les nombreux modèles ex æquo, ce qui impose de regarder les positions relatives plutôt que les seuls pourcentages.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurDeepSeek
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)95,0 %21ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)92,0 %56ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)88,0 %56ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)71,0 %47ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ deepseek-chat-v3-0324100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ deepseek-chat-v3-0324100 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable5 min 59 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Le modèle affiche des résultats élevés sur l’ensemble des évaluations Baseline. Mathematics constitue son meilleur classement réellement distinctif, aux portes du top 20 et à égalité avec quatre autres modèles. Sur Ethics, deepseek-chat-v3-0324 atteint le plafond et partage la première place avec 71 autres modèles. Hallucinations, General Knowledge, Email Classification et Coding présentent également des scores bruts élevés, signe d’un profil régulier sur les tâches testées.

Limites et points d’attention. Les six benchmarks sont plafonnés et non discriminants. Les scores élevés masquent donc parfois des positions en retrait. General Knowledge illustre ce phénomène : malgré le plafond atteint, le modèle partage seulement la 47e place avec 24 autres. Email Classification représente sa faiblesse la plus nette, avec une 100e place partagée sur 163 modèles. Coding le place en milieu de tableau, tandis que Hallucinations aboutit également à une 47e place partagée. Ces résultats décrivent un modèle solide en valeur absolue, mais dont les scores maximaux ou presque maximaux ne garantissent pas une position de premier plan.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).