qwen3-14b-04-28

qwen3-14b-04-28 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil Benchable couvre le raisonnement, les connaissances générales, le code, l’éthique, la classification d’e-mails et le suivi d’instructions.

qwen3-14b-04-28 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil Benchable couvre le raisonnement, les connaissances générales, le code, l’éthique, la classification d’e-mails et le suivi d’instructions.

Le modèle obtient des scores bruts élevés dans la plupart de ces évaluations. Les classements nuancent toutefois ce constat : le raisonnement ressort comme son principal point fort, tandis que le suivi d’instructions constitue sa faiblesse la plus nette.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)98,8 %83ᵉ / 161benchable✅ Mesuré
Benchable : Reasoning (Baseline)98,0 %16ᵉ / 155benchable✅ Mesuré
Benchable : Email Classification (Baseline)97,0 %100ᵉ / 163benchable✅ Mesuré
Benchable : Coding (Baseline)91,0 %66ᵉ / 162benchable✅ Mesuré
Benchable : Instruction Following (Baseline)50,5 %109ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)28,0 %138ᵉ / 146benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

ui-tars-1.5-7b99 %
▶ qwen3-14b-04-2899 %
uncensored99 %

Benchable : General Knowledge (Baseline)

uncensored99 %
▶ qwen3-14b-04-2899 %
hermes-3-llama-3.1-405b98 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable14 min 36 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. Reasoning offre à qwen3-14b-04-28 son meilleur placement : il partage la 16e place avec 14 autres modèles. Le benchmark est plafonné et départage donc mal ce groupe, mais le modèle y réussit 98% des tests. Coding le place dans la première moitié du classement, avec 91% de réussite et une 66e place partagée avec sept autres modèles. General Knowledge atteint 99%, même si son 83e rang sur 161 correspond au milieu de tableau.

Limites et points d'attention. Instruction Following est le principal point faible : son score tombe à 51% et le modèle se classe 109e sur 163. Email Classification affiche 97%, mais qwen3-14b-04-28 partage seulement la 100e place avec 21 autres modèles sur un benchmark plafonné. Ethics présente la même difficulté de lecture : le score de 99% conduit à une 73e place partagée avec 30 autres modèles. Le modèle paraît donc surtout pertinent pour le raisonnement et le code, moins pour les tâches qui exigent un respect précis des consignes.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).