Qwen3.5-397B-A17B

Publié par Qwen le 16 février 2026, Qwen3.5-397B-A17B est un modèle de langage causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 397 milliards de paramètres, dont 17 milliards sont activés, et combine Gated Delta…

Publié par Qwen le 16 février 2026, Qwen3.5-397B-A17B est un modèle de langage causal open-weights sous licence Apache 2.0, avec usage commercial autorisé. Son architecture Mixture-of-Experts réunit 397 milliards de paramètres, dont 17 milliards sont activés, et combine Gated Delta Networks, Gated Attention et encodeur vision.

Le modèle accepte nativement 262 144 tokens de contexte, avec une extension annoncée jusqu’à 1 010 000 tokens, et couvre 201 langues et dialectes. Ses poids et configurations sont proposés au format Hugging Face Transformers, avec une compatibilité annoncée pour vLLM, SGLang et KTransformers. Son positionnement tarifaire est très économique face aux LLM comparables.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie16 février 2026
Multimodaloui
Paramètres397 milliards
Paramètres actifs17 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index33.743ᵉ / 137
Code Index48.235ᵉ / 74
Agentic Index19.840ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MMLU-Redux94,9 %2ᵉ / 48llm-statsAuto-déclaré
HMMT 202594,8 %7ᵉ / 33llm-statsAuto-déclaré
C-Eval93,0 %2ᵉ / 18llm-statsAuto-déclaré
HMMT2592,7 %3ᵉ / 25llm-statsAuto-déclaré
IFEval92,6 %8ᵉ / 65llm-statsAuto-déclaré
AIME 202691,3 %10ᵉ / 17llm-statsAuto-déclaré
Global PIQA89,8 %5ᵉ / 13llm-statsAuto-déclaré
MMMLU88,5 %17ᵉ / 49llm-statsAuto-déclaré
GPQA88,4 %26ᵉ / 219llm-statsAuto-déclaré
MAXIFE88,2 %3ᵉ / 11llm-statsAuto-déclaré
MMLU-Pro87,8 %5ᵉ / 125llm-statsAuto-déclaré
t2-bench86,7 %4ᵉ / 23llm-statsAuto-déclaré
Include85,6 %3ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX84,7 %3ᵉ / 32llm-statsAuto-déclaré
LiveCodeBench v683,6 %12ᵉ / 53llm-statsAuto-déclaré
IMO-AnswerBench80,9 %14ᵉ / 19llm-statsAuto-déclaré
WMT24++78,9 %8ᵉ / 23llm-statsAuto-déclaré
IFBench76,5 %6ᵉ / 27llm-statsAuto-déclaré
SWE-Bench Verified76,4 %29ᵉ / 102llm-statsAuto-déclaré
WideSearch74,0 %5ᵉ / 9llm-statsAuto-déclaré
PolyMATH73,3 %4ᵉ / 23llm-statsAuto-déclaré
BFCL-V472,9 %2ᵉ / 13llm-statsAuto-déclaré
SuperGPQA70,4 %5ᵉ / 34llm-statsAuto-déclaré
BrowseComp-zh70,3 %1ᵉ / 13llm-statsAuto-déclaré
SWE-bench Multilingual69,3 %20ᵉ / 34llm-statsAuto-déclaré
BrowseComp69,0 %28ᵉ / 57llm-statsAuto-déclaré
AA-LCR68,7 %4ᵉ / 15llm-statsAuto-déclaré
Multi-Challenge67,6 %5ᵉ / 28llm-statsAuto-déclaré
LongBench v263,2 %1ᵉ / 15llm-statsAuto-déclaré
NOVA-6359,1 %1ᵉ / 11llm-statsAuto-déclaré
Terminal-Bench 2.052,5 %32ᵉ / 49llm-statsAuto-déclaré
VITA-Bench49,7 %1ᵉ / 10llm-statsAuto-déclaré
Seal-046,9 %4ᵉ / 6llm-statsAuto-déclaré
MCP-Mark46,1 %6ᵉ / 8llm-statsAuto-déclaré
Toolathlon38,3 %25ᵉ / 30llm-statsAuto-déclaré
DeepPlanning34,3 %3ᵉ / 9llm-statsAuto-déclaré
GDPval-AA32,0 %35ᵉ / 39llm-statsn.d.
Humanity's Last Exam28,7 %43ᵉ / 89llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Qwen3.5-397B-A17B33.7
Qwen3.5 397B A17B32.0

Code Index

Nemotron 3 Ultra 550B A…49.3
▶ Qwen3.5-397B-A17B48.2

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
64ᵉGrok 4.31442
65ᵉGLM-4.71442
66ᵉQwen3.5-397B-A17B1442
67ᵉinkling1441
68ᵉGLM-5V-Turbo1439

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
46ᵉGPT-5.21406
47ᵉGPT-5.4 mini1398
48ᵉQwen3.5-397B-A17B1396
49ᵉMiniMax M2.71395
50ᵉGLM-5V-Turbo1395

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
28ᵉGrok-4.20 Beta1253
29ᵉGrok-4.20 Multi-Agent Beta1250
30ᵉQwen3.5-397B-A17B1250
31ᵉGPT-5.11250
32ᵉGrok 4.31247

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DigitalOcean0,385 $2,45 $0,111 $

Prix en dollars US par million de tokens.

Sa tarification se situe 82 % en dessous de la moyenne des LLM similaires, et 14,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,81 $
Latence moyenne par benchmark — Benchable1 h 33 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. Qwen3.5-397B-A17B obtient des résultats parfaits et une première place sur General Knowledge, Email Classification et Ethics. Il reste également solide en Reasoning et Mathematics, tandis que son score sur Hallucinations atteint 98 %. À sa sortie, il figurait dans le top 6 % des LLM de sa génération sur GPQA. Sa grande fenêtre de contexte, sa couverture multilingue et son encodeur vision élargissent son champ d’application. La licence Apache 2.0 autorise les usages commerciaux, et le tarif se situe 81 % sous la moyenne des LLM similaires, soit environ 14,3 fois moins que les modèles frontière.

Limites et points d'attention. Les classements globaux sont moins dominants que les meilleurs benchmarks ciblés : l’Intelligence Index, le Code Index et l’Agentic Index placent le modèle dans une zone intermédiaire de leurs comparatifs. Les évaluations Arena confirment cet écart, avec des positions de milieu de tableau en texte et en code, malgré un classement plus favorable en vision. L’architecture compte 397 milliards de paramètres au total, même si 17 milliards seulement sont activés, ce qui reste un élément important pour le déploiement. Le modèle convient surtout aux projets recherchant des poids ouverts, un contexte très long, une couverture multilingue étendue et un coût d’usage contenu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).