qwen3-next-80b-a3b-thinking-2509

qwen3-next-80b-a3b-thinking-2509 est un LLM développé par Alibaba Cloud et la Qwen Team. Son profil Benchable est généraliste, avec des résultats élevés en connaissances générales, classification d’e-mails, raisonnement, programmation, éthique et hallucinations.

qwen3-next-80b-a3b-thinking-2509 est un LLM développé par Alibaba Cloud et la Qwen Team. Son profil Benchable est généraliste, avec des résultats élevés en connaissances générales, classification d’e-mails, raisonnement, programmation, éthique et hallucinations.

Le modèle se distingue surtout par la régularité de ses scores. Plusieurs tests atteignent toutefois leur plafond et regroupent de nombreux ex æquo. Les rangs apportent donc une lecture plus utile que les seuls pourcentages, notamment en Coding, où le classement reste plus discriminant.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids▫ n.d.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
Benchable : Ethics (Baseline)100,0 %1ᵉ / 159benchable✅ Mesuré
Benchable : General Knowledge (Baseline)99,5 %47ᵉ / 161benchable✅ Mesuré
Benchable : Email Classification (Baseline)99,0 %11ᵉ / 163benchable✅ Mesuré
Benchable : Hallucinations (Baseline)98,0 %47ᵉ / 146benchable✅ Mesuré
Benchable : Reasoning (Baseline)96,0 %32ᵉ / 155benchable✅ Mesuré
Benchable : Coding (Baseline)94,9 %31ᵉ / 162benchable✅ Mesuré
Benchable : Mathematics (Baseline)88,9 %81ᵉ / 140benchable✅ Mesuré
Benchable : Instruction Following (Baseline)14,7 %140ᵉ / 163benchable✅ Mesuré

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Benchable : Ethics (Baseline)

▶ qwen3-next-80b-a3b-thin…100 %
command-r-plus-08-202499 %

Benchable : General Knowledge (Baseline)

▶ qwen3-next-80b-a3b-thin…100 %

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,81 $
Latence moyenne par benchmark — Benchable35 min 44 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. qwen3-next-80b-a3b-thinking-2509 obtient des résultats élevés dans toutes les catégories évaluées. En Email Classification, il atteint 99% et partage la 11e place avec 40 autres modèles. Son score de 96% en Reasoning le place 32e sur 155, à égalité avec 9 concurrents. Coding fournit le repère le plus lisible de la série : avec 95% et une 31e place sur 162, le modèle se situe dans le premier cinquième du classement.

Limites et points d'attention. Cinq benchmarks sont plafonnés, ce qui réduit fortement leur pouvoir de comparaison. En Ethics, le score parfait est partagé avec 71 autres modèles. En General Knowledge, un autre score parfait correspond seulement à une 47e place partagée avec 24 modèles. Le constat est similaire sur Hallucinations, où 98% conduit à la 47e place avec 18 autres modèles. Ces ex æquo empêchent d’établir une avance nette. Même sur Coding, le modèle reste hors des trente premières places. Son profil convient donc surtout à des usages généralistes qui recherchent des résultats homogènes dans plusieurs catégories.


Sources des données : LLM-Stats (llm-stats.com) · Benchable.ai (benchable.ai).