qwen3-235b-a22b-04-28
qwen3-235b-a22b-04-28 est un LLM développé par Alibaba Cloud et la Qwen Team. Son profil se distingue surtout en programmation, domaine dans lequel il obtient son résultat le plus compétitif. Le raisonnement constitue également un point fort.
qwen3-235b-a22b-04-28 est un LLM développé par Alibaba Cloud et la Qwen Team. Son profil se distingue surtout en programmation, domaine dans lequel il obtient son résultat le plus compétitif. Le raisonnement constitue également un point fort.
Le modèle présente toutefois un équilibre très contrasté selon les tâches. Ses résultats élevés sur plusieurs tests plafonnés différencient peu les concurrents, tandis que le suivi des instructions révèle une faiblesse nette. Cette combinaison impose de regarder les classements autant que les scores bruts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 100,0 % | 1ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 99,0 % | 73ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 98,0 % | 16ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 97,0 % | 4ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 40,4 % | 125ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : General Knowledge (Baseline)
Benchable : Email Classification (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,05 $ |
| Latence moyenne par benchmark — Benchable | 39 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Sur Coding, qwen3-235b-a22b-04-28 atteint 97% et se classe 4e sur 162, ce qui le place dans le top 10. Reasoning confirme ce bon niveau avec 98% et une 16e place partagée avec 14 autres modèles. Le modèle obtient aussi 100% sur General Knowledge et Email Classification. Il partage toutefois la première place avec respectivement 41 et 9 autres modèles sur ces benchmarks plafonnés. Ces deux résultats valident la réussite des tâches évaluées, sans établir de supériorité nette sur les nombreux ex æquo.
Limites et points d'attention. Instruction Following constitue la faiblesse principale : le modèle n'obtient que 40% et se classe 125e sur 163. Ce recul est important pour les usages qui exigent une exécution précise et régulière des consignes. Le score de 99% sur Ethics doit aussi être relativisé : qwen3-235b-a22b-04-28 partage la 73e place avec 30 autres modèles sur un test plafonné. Son profil convient donc surtout aux tâches centrées sur le code et le raisonnement, avec un contrôle renforcé du respect des instructions.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).