qwen3-30b-a3b-04-28
qwen3-30b-a3b-04-28 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil Benchable couvre les connaissances générales, l’éthique, la classification d’e-mails, les hallucinations, le raisonnement et le code.
qwen3-30b-a3b-04-28 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil Benchable couvre les connaissances générales, l’éthique, la classification d’e-mails, les hallucinations, le raisonnement et le code.
Le modèle se caractérise par des scores de baseline élevés et resserrés sur l’ensemble de ces tâches. Plusieurs benchmarks atteignent toutefois leur plafond et regroupent de nombreux modèles à égalité. Les notes brutes apparaissent donc flatteuses, tandis que les rangs révèlent des écarts plus marqués selon les épreuves.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 96,0 % | 67ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 96,0 % | 32ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 94,0 % | 32ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 60,8 % | 86ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Ethics (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 19 min 32 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Email Classification constitue son résultat le mieux classé hors égalités au premier rang : qwen3-30b-a3b-04-28 obtient 99% et partage la 11e place avec 40 autres modèles. Reasoning atteint 96% et Coding 94%. Le modèle partage la 32e place dans les deux cas, avec respectivement neuf et huit concurrents. General Knowledge et Ethics atteignent 100%. Ces deux résultats confirment une bonne maîtrise des tests de baseline, sans départager le modèle des nombreux ex æquo.
Limites et points d’attention. Les six benchmarks sont signalés comme plafonnés et non discriminants. General Knowledge regroupe 42 modèles à la première place, qwen3-30b-a3b-04-28 inclus, tandis qu’Ethics en rassemble 72. Le contraste est particulièrement net sur Hallucinations : malgré un score de 96%, le modèle partage seulement la 67e place sur 146 avec neuf autres modèles. Les résultats doivent donc être interprétés à partir des rangs et du nombre d’ex æquo, plutôt qu’à partir des seuls pourcentages.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).