Qwen3.5-397B-A17B
Publié par Qwen le 16 février 2026, Qwen3.5-397B-A17B est un modèle de langage causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 397 milliards de paramètres, dont 17 milliards sont activés, et combine Gated Delta…
Publié par Qwen le 16 février 2026, Qwen3.5-397B-A17B est un modèle de langage causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 397 milliards de paramètres, dont 17 milliards sont activés, et combine Gated Delta Networks, Gated Attention et encodeur vision.
Le modèle accepte nativement 262 144 tokens de contexte, avec une extension annoncée jusqu’à 1 010 000 tokens, et couvre 201 langues et dialectes. Ses poids et configurations sont proposés au format Hugging Face Transformers, avec une compatibilité annoncée pour vLLM, SGLang et KTransformers. Son positionnement tarifaire est très économique face aux LLM comparables.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 16 février 2026 |
| Multimodal | oui |
| Paramètres | 397 milliards |
| Paramètres actifs | 17 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 33.7 | 43ᵉ / 137 |
| Code Index | 48.2 | 35ᵉ / 74 |
| Agentic Index | 19.8 | 40ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| MMLU-Redux | 94,9 % | 2ᵉ / 48 | llm-stats | Auto-déclaré |
| HMMT 2025 | 94,8 % | 7ᵉ / 33 | llm-stats | Auto-déclaré |
| C-Eval | 93,0 % | 2ᵉ / 18 | llm-stats | Auto-déclaré |
| HMMT25 | 92,7 % | 3ᵉ / 25 | llm-stats | Auto-déclaré |
| IFEval | 92,6 % | 8ᵉ / 65 | llm-stats | Auto-déclaré |
| AIME 2026 | 91,3 % | 10ᵉ / 17 | llm-stats | Auto-déclaré |
| Global PIQA | 89,8 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMLU | 88,5 % | 17ᵉ / 49 | llm-stats | Auto-déclaré |
| GPQA | 88,4 % | 26ᵉ / 219 | llm-stats | Auto-déclaré |
| MAXIFE | 88,2 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| MMLU-Pro | 87,8 % | 5ᵉ / 125 | llm-stats | Auto-déclaré |
| t2-bench | 86,7 % | 4ᵉ / 23 | llm-stats | Auto-déclaré |
| Include | 85,6 % | 3ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 84,7 % | 3ᵉ / 32 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 83,6 % | 12ᵉ / 53 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 80,9 % | 14ᵉ / 19 | llm-stats | Auto-déclaré |
| WMT24++ | 78,9 % | 8ᵉ / 23 | llm-stats | Auto-déclaré |
| IFBench | 76,5 % | 6ᵉ / 27 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 76,4 % | 29ᵉ / 102 | llm-stats | Auto-déclaré |
| WideSearch | 74,0 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| PolyMATH | 73,3 % | 4ᵉ / 23 | llm-stats | Auto-déclaré |
| BFCL-V4 | 72,9 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| SuperGPQA | 70,4 % | 5ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 70,3 % | 1ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 69,3 % | 20ᵉ / 34 | llm-stats | Auto-déclaré |
| BrowseComp | 69,0 % | 28ᵉ / 57 | llm-stats | Auto-déclaré |
| AA-LCR | 68,7 % | 4ᵉ / 15 | llm-stats | Auto-déclaré |
| Multi-Challenge | 67,6 % | 5ᵉ / 28 | llm-stats | Auto-déclaré |
| LongBench v2 | 63,2 % | 1ᵉ / 15 | llm-stats | Auto-déclaré |
| NOVA-63 | 59,1 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 52,5 % | 32ᵉ / 49 | llm-stats | Auto-déclaré |
| VITA-Bench | 49,7 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| Seal-0 | 46,9 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
| MCP-Mark | 46,1 % | 6ᵉ / 8 | llm-stats | Auto-déclaré |
| Toolathlon | 38,3 % | 25ᵉ / 30 | llm-stats | Auto-déclaré |
| DeepPlanning | 34,3 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| GDPval-AA | 32,0 % | 35ᵉ / 39 | llm-stats | n.d. |
| Humanity's Last Exam | 28,7 % | 43ᵉ / 89 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 64ᵉ | Grok 4.3 | 1442 |
| 65ᵉ | GLM-4.7 | 1442 |
| 66ᵉ | Qwen3.5-397B-A17B | 1442 |
| 67ᵉ | inkling | 1441 |
| 68ᵉ | GLM-5V-Turbo | 1439 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 46ᵉ | GPT-5.2 | 1406 |
| 47ᵉ | GPT-5.4 mini | 1398 |
| 48ᵉ | Qwen3.5-397B-A17B | 1396 |
| 49ᵉ | MiniMax M2.7 | 1395 |
| 50ᵉ | GLM-5V-Turbo | 1395 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 28ᵉ | Grok-4.20 Beta | 1253 |
| 29ᵉ | Grok-4.20 Multi-Agent Beta | 1250 |
| 30ᵉ | Qwen3.5-397B-A17B | 1250 |
| 31ᵉ | GPT-5.1 | 1250 |
| 32ᵉ | Grok 4.3 | 1247 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DigitalOcean | 0,385 $ | 2,45 $ | 0,111 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 82 % en dessous de la moyenne des LLM similaires, et 14,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,81 $ |
| Latence moyenne par benchmark — Benchable | 1 h 33 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. Qwen3.5-397B-A17B obtient des résultats parfaits et une première place sur General Knowledge, Email Classification et Ethics. Il reste également solide en Reasoning et Mathematics, tandis que son score sur Hallucinations atteint 98 %. À sa sortie, il figurait dans le top 6 % des LLM de sa génération sur GPQA. Sa grande fenêtre de contexte, sa couverture multilingue et son encodeur vision élargissent son champ d’application. La licence Apache 2.0 autorise les usages commerciaux, et le tarif se situe 81 % sous la moyenne des LLM similaires, soit environ 14,3 fois moins que les modèles frontière.
Limites et points d'attention. Les classements globaux sont moins dominants que les meilleurs benchmarks ciblés : l’Intelligence Index, le Code Index et l’Agentic Index placent le modèle dans une zone intermédiaire de leurs comparatifs. Les évaluations Arena confirment cet écart, avec des positions de milieu de tableau en texte et en code, malgré un classement plus favorable en vision. L’architecture compte 397 milliards de paramètres au total, même si 17 milliards seulement sont activés, ce qui reste un élément important pour le déploiement. Le modèle convient surtout aux projets recherchant des poids ouverts, un contexte très long, une couverture multilingue étendue et un coût d’usage contenu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).