Qwen3-Next-80B-A3B-Thinking

Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Thinking est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Ses 80 milliards de paramètres reposent sur une architecture Mixture-of-Experts fortement parcimonieuse, avec 3 milliards de paramètres activés.

Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Thinking est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Ses 80 milliards de paramètres reposent sur une architecture Mixture-of-Experts fortement parcimonieuse, avec 3 milliards de paramètres activés.

Le modèle se distingue par un mode thinking systématique, destiné aux raisonnements très complexes, et par un contexte natif de 262 144 tokens, extensible jusqu’à 1 010 000 tokens. Son architecture associe Hybrid Attention, Gated DeltaNet, Gated Attention et Multi-Token Prediction. Le déploiement est possible avec Transformers, SGLang ou vLLM, via des endpoints compatibles OpenAI.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie10 septembre 2025
Multimodalnon
Paramètres80 milliards
Fenêtre de contexte65 536 tokens
Modalités (entrée → sortie)text → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMLU-Redux92,5 %18ᵉ / 48llm-statsAuto-déclaré
IFEval88,9 %22ᵉ / 65llm-statsAuto-déclaré
AIME 202587,8 %48ᵉ / 108llm-statsAuto-déclaré
WritingBench84,6 %9ᵉ / 15llm-statsAuto-déclaré
MMLU-Pro82,7 %31ᵉ / 125llm-statsAuto-déclaré
Include78,9 %13ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX78,7 %13ᵉ / 32llm-statsAuto-déclaré
Multi-IF77,8 %5ᵉ / 20llm-statsAuto-déclaré
GPQA77,2 %89ᵉ / 219llm-statsAuto-déclaré
LiveBench 2024112576,6 %3ᵉ / 14llm-statsAuto-déclaré
HMMT2573,9 %16ᵉ / 25llm-statsAuto-déclaré
BFCL-v372,0 %4ᵉ / 19llm-statsAuto-déclaré
TAU-bench Retail69,6 %11ᵉ / 24llm-statsAuto-déclaré
LiveCodeBench v668,7 %33ᵉ / 53llm-statsAuto-déclaré
Tau2 Retail67,8 %21ᵉ / 25llm-statsAuto-déclaré
Arena-Hard v262,3 %10ᵉ / 16llm-statsAuto-déclaré
SuperGPQA60,8 %16ᵉ / 34llm-statsAuto-déclaré
Tau2 Airline60,5 %11ᵉ / 22llm-statsAuto-déclaré
PolyMATH56,3 %10ᵉ / 23llm-statsAuto-déclaré
TAU-bench Airline49,0 %14ᵉ / 22llm-statsAuto-déclaré
Tau2 Telecom43,9 %31ᵉ / 34llm-statsAuto-déclaré
OJBench29,7 %7ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
160ᵉClaude 3.5 Sonnet1373
161ᵉClaude 3.7 Sonnet1371
162ᵉQwen3-Next-80B-A3B-Thinking1370
163ᵉArcee AI: Trinity Large Thinking1369
164ᵉGLM-4.7-Flash1368

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,0975 $0,78 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 56,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, Qwen3-Next-80B-A3B-Thinking figurait dans le top 21% des LLM de sa génération sur GPQA, un résultat qui le situait dans le haut du panier sur ce benchmark. Son contexte natif très étendu favorise le traitement de longs contenus, tandis que l’activation de 3 milliards de paramètres sur 80 milliards caractérise une architecture Mixture-of-Experts à forte sparsité. Son autre avantage majeur est économique : sa tarification se situe 95% sous la moyenne des LLM similaires et environ 56,4 fois sous celle des modèles frontière. La licence Apache 2.0 autorise en outre les usages commerciaux.

Limites et points d'attention. Le classement Arena text place le modèle dans le bas du tableau, loin du modèle en tête, ce qui tempère son positionnement malgré son résultat favorable sur GPQA. Qwen3-Next-80B-A3B-Thinking fonctionne exclusivement en mode thinking : son template de chat insère automatiquement <think>, sans mode conversationnel direct alternatif. Cette spécialisation réduit sa polyvalence lorsque le raisonnement explicite n’est pas recherché. Le modèle convient principalement aux tâches de raisonnement très complexes, aux traitements de contexte long et aux déploiements sensibles au coût.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).