qwen3-next-80b-a3b-instruct-2509
qwen3-next-80b-a3b-instruct-2509 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil d’évaluation couvre les connaissances générales, l’éthique, les hallucinations, la classification d’e-mails, les mathématiques et le code.
qwen3-next-80b-a3b-instruct-2509 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil d’évaluation couvre les connaissances générales, l’éthique, les hallucinations, la classification d’e-mails, les mathématiques et le code.
Le modèle obtient des scores bruts élevés dans l’ensemble de ces catégories. Sa lecture exige toutefois de considérer les nombreux ex æquo et le plafonnement des benchmarks, qui réduisent fortement la portée des premières places affichées.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | ▫ n.d. |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| Benchable : Hallucinations (Baseline) | 100,0 % | 1ᵉ / 146 | benchable | ✅ Mesuré |
| Benchable : General Knowledge (Baseline) | 100,0 % | 1ᵉ / 161 | benchable | ✅ Mesuré |
| Benchable : Ethics (Baseline) | 100,0 % | 1ᵉ / 159 | benchable | ✅ Mesuré |
| Benchable : Email Classification (Baseline) | 99,0 % | 11ᵉ / 163 | benchable | ✅ Mesuré |
| Benchable : Mathematics (Baseline) | 93,0 % | 44ᵉ / 140 | benchable | ✅ Mesuré |
| Benchable : Coding (Baseline) | 92,0 % | 56ᵉ / 162 | benchable | ✅ Mesuré |
| Benchable : Reasoning (Baseline) | 88,0 % | 56ᵉ / 155 | benchable | ✅ Mesuré |
| Benchable : Instruction Following (Baseline) | 63,0 % | 74ᵉ / 163 | benchable | ✅ Mesuré |
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Benchable : Hallucinations (Baseline)
Benchable : General Knowledge (Baseline)
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,03 $ |
| Latence moyenne par benchmark — Benchable | 2 min 58 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. qwen3-next-80b-a3b-instruct-2509 affiche des résultats homogènes sur des tâches variées. Email Classification constitue son placement relatif le plus favorable : le modèle partage la 11e place sur 163 avec 40 autres modèles. Il conserve aussi des scores bruts élevés en Mathematics et Coding, à 93% et 92%. Cette combinaison montre un profil équilibré dans le cadre des évaluations Baseline.
Limites et points d’attention. Les six benchmarks sont plafonnés et donc peu discriminants. Les scores de 100% en Hallucinations, General Knowledge et Ethics correspondent à des places partagées avec respectivement 45, 41 et 71 autres modèles. Ils ne permettent pas d’établir une supériorité nette. Le classement est moins favorable en Mathematics, avec une 44e place partagée sur 140, et en Coding, avec une 56e place partagée sur 162. Le modèle apparaît ainsi pertinent pour des usages généralistes, tandis que les tâches mathématiques et de programmation demandent une évaluation complémentaire.
Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).