qwen3-next-80b-a3b-instruct-2509

qwen3-next-80b-a3b-instruct-2509 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil d’évaluation couvre les connaissances générales, l’éthique, les hallucinations, la classification d’e-mails, les mathématiques et le code.

qwen3-next-80b-a3b-instruct-2509 est un LLM édité par Alibaba Cloud et la Qwen Team. Son profil d’évaluation couvre les connaissances générales, l’éthique, les hallucinations, la classification d’e-mails, les mathématiques et le code.

Le modèle obtient des scores bruts élevés dans l’ensemble de ces catégories. Sa lecture exige toutefois de considérer les nombreux ex æquo et le plafonnement des benchmarks, qui réduisent fortement la portée des premières places affichées.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Hallucinations (Baseline)100,0 %1ᵉ / 146benchable✅ Mesuré
Benchable : General Knowledge (Baseline)100,0 %1ᵉ / 161benchable✅ Mesuré
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Mathematics (Baseline)93,0 %44ᵉ / 140benchable✅ Mesuré
Benchable : Coding (Baseline)92,0 %56ᵉ / 162benchable✅ Mesuré
Benchable : Reasoning (Baseline)88,0 %56ᵉ / 155benchable✅ Mesuré
Benchable : Instruction Following (Baseline)63,0 %74ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Hallucinations (Baseline)

▶ qwen3-next-80b-a3b-inst…100 %

Benchable : General Knowledge (Baseline)

▶ qwen3-next-80b-a3b-inst…100 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,03 $
Latence moyenne par benchmark — Benchable2 min 58 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. qwen3-next-80b-a3b-instruct-2509 affiche des résultats homogènes sur des tâches variées. Email Classification constitue son placement relatif le plus favorable : le modèle partage la 11e place sur 163 avec 40 autres modèles. Il conserve aussi des scores bruts élevés en Mathematics et Coding, à 93% et 92%. Cette combinaison montre un profil équilibré dans le cadre des évaluations Baseline.

Limites et points d’attention. Les six benchmarks sont plafonnés et donc peu discriminants. Les scores de 100% en Hallucinations, General Knowledge et Ethics correspondent à des places partagées avec respectivement 45, 41 et 71 autres modèles. Ils ne permettent pas d’établir une supériorité nette. Le classement est moins favorable en Mathematics, avec une 44e place partagée sur 140, et en Coding, avec une 56e place partagée sur 162. Le modèle apparaît ainsi pertinent pour des usages généralistes, tandis que les tâches mathématiques et de programmation demandent une évaluation complémentaire.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).