qwen3-235b-a22b-07-25
qwen3-235b-a22b-07-25 est un LLM d’Alibaba Cloud, développé par la Qwen Team. Son profil d’évaluation se distingue surtout par de solides résultats en mathématiques et par des scores maximaux sur plusieurs tests de connaissances, d’éthique et de classification thématique.
qwen3-235b-a22b-07-25 est un LLM d’Alibaba Cloud, développé par la Qwen Team. Son profil d’évaluation se distingue surtout par de solides résultats en mathématiques et par des scores maximaux sur plusieurs tests de connaissances, d’éthique et de classification thématique.
Ces résultats bruts masquent toutefois d’importants écarts selon les tâches. Plusieurs benchmarks sont plafonnés et départagent mal les modèles, tandis que le codage et la classification d’e-mails placent qwen3-235b-a22b-07-25 en retrait.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Keyword Topic Relevance Classification | 100,0 % | 1ᵉ / 6 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 99,5 % | 47ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 97,0 % | 4ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 94,0 % | 135ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 85,9 % | 93ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 84,0 % | 63ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 39,7 % | 126ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Keyword Topic Relevance Classification
Benchable : Ethics (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 10 min 57 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Mathematics (Baseline) constitue le résultat le plus significatif : qwen3-235b-a22b-07-25 partage la quatrième place avec un autre modèle. Le test reste plafonné, mais ce classement situe le modèle dans le haut du tableau. Sur Keyword Topic Relevance Classification, il partage la première place avec deux autres modèles sur six. Ethics (Baseline) atteint aussi le plafond, avec une première place partagée avec 71 autres modèles. Ces égalités indiquent que le modèle satisfait pleinement les critères de ces tests, sans établir de supériorité sur ses nombreux ex æquo.
Limites et points d’attention. Les scores parfaits sont peu discriminants. Sur General Knowledge (Baseline), le modèle obtient le maximum, mais partage seulement la 47e place avec 24 autres modèles. Email Classification (Baseline) illustre encore davantage cette saturation : malgré 94%, qwen3-235b-a22b-07-25 se classe 135e sur 163. Le codage représente une faiblesse plus nette. Avec 86% et un rang de 93e sur 162 dans Coding (Baseline), le modèle se situe dans la seconde moitié du classement. Son profil apparaît donc nettement plus solide en mathématiques que dans les tâches de code ou de tri d’e-mails.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).