qwen3-8b-04-28

qwen3-8b-04-28 est un LLM d’Alibaba Cloud et de la Qwen Team. Son profil Benchable est contrasté : il obtient des scores élevés sur Ethics, Email Classification et General Knowledge, trois épreuves toutefois plafonnées qui départagent peu les modèles.

qwen3-8b-04-28 est un LLM d’Alibaba Cloud et de la Qwen Team. Son profil Benchable est contrasté : il obtient des scores élevés sur Ethics, Email Classification et General Knowledge, trois épreuves toutefois plafonnées qui départagent peu les modèles.

Les tâches plus exigeantes révèlent un positionnement moins favorable. Mathematics se situe dans la seconde moitié du classement, tandis qu’Instruction Following et Reasoning figurent nettement en retrait. Le modèle apparaît ainsi plus convaincant sur la classification et les connaissances générales que sur le raisonnement et l’exécution précise de consignes.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)99,0 %73ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)98,0 %55ᵉ / 163benchable✅ Mesuré
Benchable : General Knowledge (Baseline)97,5 %97ᵉ / 161benchable✅ Mesuré
Benchable : Mathematics (Baseline)85,0 %92ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)60,0 %88ᵉ / 163benchable✅ Mesuré
Benchable : Reasoning (Baseline)56,0 %109ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)34,0 %145ᵉ / 162benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

ui-tars-1.5-7b99 %
▶ qwen3-8b-04-2899 %
uncensored99 %

Benchable : Email Classification (Baseline)

hermes-3-llama-3.1-405b100 %
skyfall-36b-v298 %
▶ qwen3-8b-04-2898 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,01 $
Latence moyenne par benchmark — Benchable41 min 46 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. qwen3-8b-04-28 atteint des niveaux élevés sur Ethics, Email Classification et General Knowledge. Ces résultats indiquent une bonne maîtrise des réponses attendues dans ces évaluations de référence. Ils doivent toutefois être lus comme des seuils validés plutôt que comme des avantages concurrentiels : le modèle partage sa place avec 30 autres modèles sur Ethics et avec 42 autres sur Email Classification. Son résultat en Mathematics reste notable en valeur absolue, même si son classement le place dans la seconde moitié du panel.

Limites et points d'attention. Le modèle est en retrait sur les aptitudes qui distinguent davantage les LLM polyvalents. En Instruction Following, il partage la 88e place sur 163, avec un score de 60%. En Reasoning, il descend à la 109e place sur 155, avec 56%. Mathematics suit la même tendance au classement, à la 92e place sur 140. Les scores presque saturés des trois meilleurs résultats masquent donc un positionnement global moyen ou faible. qwen3-8b-04-28 reste surtout pertinent pour des essais centrés sur la classification, l’éthique de référence et les connaissances générales, avec une vigilance accrue dès que la tâche demande plusieurs étapes de raisonnement ou un respect fin des instructions.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).