Qwen3-Next-80B-A3B-Thinking
Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Thinking est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Ses 80 milliards de paramètres reposent sur une architecture Mixture-of-Experts fortement parcimonieuse, avec 3 milliards de paramètres activés.
Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Thinking est un LLM open-weights sous licence Apache 2.0, utilisable commercialement. Ses 80 milliards de paramètres reposent sur une architecture Mixture-of-Experts fortement parcimonieuse, avec 3 milliards de paramètres activés.
Le modèle se distingue par un mode thinking systématique, destiné aux raisonnements très complexes, et par un contexte natif de 262 144 tokens, extensible jusqu’à 1 010 000 tokens. Son architecture associe Hybrid Attention, Gated DeltaNet, Gated Attention et Multi-Token Prediction. Le déploiement est possible avec Transformers, SGLang ou vLLM, via des endpoints compatibles OpenAI.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 10 septembre 2025 |
| Multimodal | non |
| Paramètres | 80 milliards |
| Fenêtre de contexte | 65 536 tokens |
| Modalités (entrée → sortie) | text → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU-Redux | 92,5 % | 18ᵉ / 48 | llm-stats | Auto-déclaré |
| IFEval | 88,9 % | 22ᵉ / 65 | llm-stats | Auto-déclaré |
| AIME 2025 | 87,8 % | 48ᵉ / 108 | llm-stats | Auto-déclaré |
| WritingBench | 84,6 % | 9ᵉ / 15 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,7 % | 31ᵉ / 125 | llm-stats | Auto-déclaré |
| Include | 78,9 % | 13ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 78,7 % | 13ᵉ / 32 | llm-stats | Auto-déclaré |
| Multi-IF | 77,8 % | 5ᵉ / 20 | llm-stats | Auto-déclaré |
| GPQA | 77,2 % | 89ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 76,6 % | 3ᵉ / 14 | llm-stats | Auto-déclaré |
| HMMT25 | 73,9 % | 16ᵉ / 25 | llm-stats | Auto-déclaré |
| BFCL-v3 | 72,0 % | 4ᵉ / 19 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 69,6 % | 11ᵉ / 24 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 68,7 % | 33ᵉ / 53 | llm-stats | Auto-déclaré |
| Tau2 Retail | 67,8 % | 21ᵉ / 25 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 62,3 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
| SuperGPQA | 60,8 % | 16ᵉ / 34 | llm-stats | Auto-déclaré |
| Tau2 Airline | 60,5 % | 11ᵉ / 22 | llm-stats | Auto-déclaré |
| PolyMATH | 56,3 % | 10ᵉ / 23 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 49,0 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 43,9 % | 31ᵉ / 34 | llm-stats | Auto-déclaré |
| OJBench | 29,7 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 160ᵉ | Claude 3.5 Sonnet | 1373 |
| 161ᵉ | Claude 3.7 Sonnet | 1371 |
| 162ᵉ | Qwen3-Next-80B-A3B-Thinking | 1370 |
| 163ᵉ | Arcee AI: Trinity Large Thinking | 1369 |
| 164ᵉ | GLM-4.7-Flash | 1368 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,0975 $ | 0,78 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 56,4 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, Qwen3-Next-80B-A3B-Thinking figurait dans le top 21% des LLM de sa génération sur GPQA, un résultat qui le situait dans le haut du panier sur ce benchmark. Son contexte natif très étendu favorise le traitement de longs contenus, tandis que l’activation de 3 milliards de paramètres sur 80 milliards caractérise une architecture Mixture-of-Experts à forte sparsité. Son autre avantage majeur est économique : sa tarification se situe 95% sous la moyenne des LLM similaires et environ 56,4 fois sous celle des modèles frontière. La licence Apache 2.0 autorise en outre les usages commerciaux.
Limites et points d'attention. Le classement Arena text place le modèle dans le bas du tableau, loin du modèle en tête, ce qui tempère son positionnement malgré son résultat favorable sur GPQA. Qwen3-Next-80B-A3B-Thinking fonctionne exclusivement en mode thinking : son template de chat insère automatiquement <think>, sans mode conversationnel direct alternatif. Cette spécialisation réduit sa polyvalence lorsque le raisonnement explicite n’est pas recherché. Le modèle convient principalement aux tâches de raisonnement très complexes, aux traitements de contexte long et aux déploiements sensibles au coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).