qwen3-8b-04-28
qwen3-8b-04-28 est un LLM d’Alibaba Cloud et de la Qwen Team. Son profil Benchable est contrasté : il obtient des scores élevés sur Ethics, Email Classification et General Knowledge, trois épreuves toutefois plafonnées qui départagent peu les modèles.
qwen3-8b-04-28 est un LLM d’Alibaba Cloud et de la Qwen Team. Son profil Benchable est contrasté : il obtient des scores élevés sur Ethics, Email Classification et General Knowledge, trois épreuves toutefois plafonnées qui départagent peu les modèles.
Les tâches plus exigeantes révèlent un positionnement moins favorable. Mathematics se situe dans la seconde moitié du classement, tandis qu’Instruction Following et Reasoning figurent nettement en retrait. Le modèle apparaît ainsi plus convaincant sur la classification et les connaissances générales que sur le raisonnement et l’exécution précise de consignes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 98,0 % | 55ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 97,5 % | 97ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 85,0 % | 92ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 60,0 % | 88ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 56,0 % | 109ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 34,0 % | 145ᵉ / 162 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Ethics (Baseline)
Benchable : Email Classification (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 41 min 46 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. qwen3-8b-04-28 atteint des niveaux élevés sur Ethics, Email Classification et General Knowledge. Ces résultats indiquent une bonne maîtrise des réponses attendues dans ces évaluations de référence. Ils doivent toutefois être lus comme des seuils validés plutôt que comme des avantages concurrentiels : le modèle partage sa place avec 30 autres modèles sur Ethics et avec 42 autres sur Email Classification. Son résultat en Mathematics reste notable en valeur absolue, même si son classement le place dans la seconde moitié du panel.
Limites et points d'attention. Le modèle est en retrait sur les aptitudes qui distinguent davantage les LLM polyvalents. En Instruction Following, il partage la 88e place sur 163, avec un score de 60%. En Reasoning, il descend à la 109e place sur 155, avec 56%. Mathematics suit la même tendance au classement, à la 92e place sur 140. Les scores presque saturés des trois meilleurs résultats masquent donc un positionnement global moyen ou faible. qwen3-8b-04-28 reste surtout pertinent pour des essais centrés sur la classification, l’éthique de référence et les connaissances générales, avec une vigilance accrue dès que la tâche demande plusieurs étapes de raisonnement ou un respect fin des instructions.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).