Qwen3-Next-80B-A3B-Instruct
Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Instruct est un LLM causal conçu exclusivement pour suivre des instructions, sans génération de blocs de raisonnement visibles. Son architecture Qwen3-Next associe attention hybride, Mixture-of-Experts fortement parcimonieux et…
Publié par Qwen le 10 septembre 2025, Qwen3-Next-80B-A3B-Instruct est un LLM causal conçu exclusivement pour suivre des instructions, sans génération de blocs de raisonnement visibles. Son architecture Qwen3-Next associe attention hybride, Mixture-of-Experts fortement parcimonieux et prédiction multi-token.
Le modèle totalise 80 milliards de paramètres, dont 3 milliards activés, et accepte nativement 262 144 tokens, avec une extension jusqu’à 1 010 000 tokens. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial. Son accès minimal gratuit et ses options de déploiement en font une offre très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 10 septembre 2025 |
| Multimodal | non |
| Paramètres | 80 milliards |
| Paramètres actifs | 3 milliards |
| Fenêtre de contexte | 65 536 tokens |
| Modalités (entrée → sortie) | text → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 13.7 | 118ᵉ / 137 |
| Math Index | 66.3 | 24ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU-Redux | 90,9 % | 23ᵉ / 48 | llm-stats | Auto-déclaré |
| MultiPL-E | 87,8 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| IFEval | 87,6 % | 31ᵉ / 65 | llm-stats | Auto-déclaré |
| WritingBench | 87,3 % | 2ᵉ / 15 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 85,3 % | 7ᵉ / 12 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 82,7 % | 2ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Pro | 80,6 % | 49ᵉ / 125 | llm-stats | Auto-déclaré |
| Include | 78,9 % | 13ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 76,7 % | 16ᵉ / 32 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 75,8 % | 4ᵉ / 14 | llm-stats | Auto-déclaré |
| Multi-IF | 75,8 % | 8ᵉ / 20 | llm-stats | Auto-déclaré |
| GPQA | 72,9 % | 110ᵉ / 219 | llm-stats | Auto-déclaré |
| BFCL-v3 | 70,3 % | 10ᵉ / 19 | llm-stats | Auto-déclaré |
| AIME 2025 | 69,5 % | 84ᵉ / 108 | llm-stats | Auto-déclaré |
| TAU-bench Retail | 60,9 % | 18ᵉ / 24 | llm-stats | Auto-déclaré |
| SuperGPQA | 58,8 % | 19ᵉ / 34 | llm-stats | Auto-déclaré |
| Tau2 Retail | 57,3 % | 24ᵉ / 25 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 56,6 % | 39ᵉ / 53 | llm-stats | Auto-déclaré |
| HMMT25 | 54,1 % | 21ᵉ / 25 | llm-stats | Auto-déclaré |
| Aider-Polyglot | 49,8 % | 16ᵉ / 22 | llm-stats | Auto-déclaré |
| PolyMATH | 45,9 % | 16ᵉ / 23 | llm-stats | Auto-déclaré |
| Tau2 Airline | 45,5 % | 20ᵉ / 22 | llm-stats | Auto-déclaré |
| TAU-bench Airline | 44,0 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| Tau2 Telecom | 13,2 % | 34ᵉ / 34 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 124ᵉ | Qwen3 235B A22B | 1403 |
| 125ᵉ | o1 | 1402 |
| 126ᵉ | Qwen3-Next-80B-A3B-Instruct | 1401 |
| 127ᵉ | LongCat-Flash-Chat | 1401 |
| 128ᵉ | Claude Sonnet 4 | 1399 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Venice (Beta) | gratuit | gratuit | n.d. |
| DeepInfra | 0,09 $ | 1,1 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 100 % en dessous de la moyenne des LLM similaires.
Notre analyse
Forces. Qwen3-Next-80B-A3B-Instruct se distingue surtout en mathématiques, où son Math Index le place dans la partie supérieure du classement considéré. À sa sortie, il figurait également dans le top 34% des LLM de sa génération sur GPQA, un résultat solide pour les questions scientifiques difficiles. Sa très longue fenêtre de contexte constitue un autre atout concret. L’architecture parcimonieuse n’active que 3 milliards de paramètres sur 80 milliards au total. Le modèle fonctionne avec Hugging Face Transformers et peut être servi par SGLang ou vLLM sous forme d’API compatible OpenAI. Son tarif minimal est gratuit, avec un positionnement intégralement sous la moyenne des LLM similaires.
Limites et points d'attention. Son Intelligence Index le situe près du bas du classement évalué, ce qui traduit des performances générales modestes malgré un meilleur niveau en mathématiques. Dans Arena text, il occupe aussi la seconde moitié du tableau et reste nettement derrière le modèle en tête. Son fonctionnement instruct exclut les blocs <think></think>, un point à considérer lorsque des traces explicites de raisonnement sont recherchées. Ses connaissances s’arrêtent au 30 septembre 2025. Il vise principalement les déploiements économiques, les contextes très longs et les usages nécessitant des poids ouverts avec usage commercial autorisé.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai).