qwen3-32b-04-28
qwen3-32b-04-28 est un LLM d’Alibaba Cloud / Qwen Team. Son profil Benchable est généraliste, avec des évaluations en General Knowledge, Reasoning, Ethics, Email Classification, Mathematics et Coding.
qwen3-32b-04-28 est un LLM d’Alibaba Cloud / Qwen Team. Son profil Benchable est généraliste, avec des évaluations en General Knowledge, Reasoning, Ethics, Email Classification, Mathematics et Coding.
Le modèle se caractérise par des résultats élevés et réguliers sur ces six tests. Plusieurs benchmarks atteignent toutefois leur plafond et regroupent de nombreux modèles à égalité, ce qui réduit leur pouvoir de comparaison. Mathematics et Coding offrent une lecture plus nuancée de son positionnement.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 100,0 % | 1ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 95,9 % | 16ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 95,0 % | 17ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Hallucinations (Baseline) | 90,0 % | 89ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 55,7 % | 97ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Reasoning (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 36 min 03 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. qwen3-32b-04-28 atteint le plafond de General Knowledge, Reasoning et Ethics. Il partage la première place avec respectivement 41, 14 et 71 autres modèles. Email Classification confirme cette régularité avec 99 %, même si la 11e place est partagée avec 40 concurrents. Les résultats restent solides sur les tâches plus techniques : le modèle obtient 96 % en Mathematics et 95 % en Coding. En Mathematics, il partage sa place avec un seul autre modèle, ce qui rend ce résultat plus distinctif que ceux des benchmarks saturés.
Limites et points d’attention. Les scores parfaits de General Knowledge, Reasoning et Ethics ne suffisent pas à établir une supériorité, car ces trois benchmarks sont plafonnés et très peu discriminants. Email Classification présente la même limite avec un ex æquo très large. Mathematics situe le modèle à la 16e place sur 140, tandis que Coding le place 17e sur 162 avec 13 autres modèles. Ces deux évaluations montrent un bon niveau, mais aussi un retrait relatif face aux premiers rangs. Le profil mesuré est donc homogène, sans avantage net démontré par ces benchmarks.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).