Qwen3.6 Plus

Qwen3.6 Plus est un LLM propriétaire de l’éditeur chinois Qwen, lancé le 31 mars 2026. Sa principale caractéristique est une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte ou de code au sein d’une même requête.

Qwen3.6 Plus est un LLM propriétaire de l’éditeur chinois Qwen, lancé le 31 mars 2026. Sa principale caractéristique est une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte ou de code au sein d’une même requête.

Le modèle associe ce contexte étendu à un positionnement très économique. Sa tarification se situe 84% sous la moyenne des LLM similaires et environ 16,9 fois sous celle des modèles frontière. Les poids ne sont pas ouverts, ce qui le distingue des modèles distribués sous licence ouverte.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🔒 Propriétaire
Date de sortie31 mars 2026
Multimodaloui
Fenêtre de contexte1 000 000 tokens (≈ 1,0 M)
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index39.625ᵉ / 137
Code Index54.528ᵉ / 74
Agentic Index27.625ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CountBench97,6 %4ᵉ / 6llm-statsAuto-déclaré
V*96,9 %1ᵉ / 7llm-statsAuto-déclaré
HMMT 202596,7 %5ᵉ / 33llm-statsAuto-déclaré
AIME 202695,3 %3ᵉ / 17llm-statsAuto-déclaré
HMMT2594,6 %2ᵉ / 25llm-statsAuto-déclaré
MMLU-Redux94,5 %3ᵉ / 48llm-statsAuto-déclaré
AI2D94,4 %2ᵉ / 32llm-statsAuto-déclaré
IFEval94,3 %3ᵉ / 65llm-statsAuto-déclaré
RefCOCO-avg93,5 %1ᵉ / 7llm-statsAuto-déclaré
C-Eval93,3 %1ᵉ / 18llm-statsAuto-déclaré
OmniDocBench 1.591,2 %3ᵉ / 13llm-statsAuto-déclaré
GPQA90,4 %18ᵉ / 219llm-statsAuto-déclaré
Global PIQA89,8 %5ᵉ / 13llm-statsAuto-déclaré
MMMLU89,5 %10ᵉ / 49llm-statsAuto-déclaré
MMLU-Pro88,5 %2ᵉ / 125llm-statsAuto-déclaré
MAXIFE88,2 %3ᵉ / 11llm-statsAuto-déclaré
DynaMath88,0 %1ᵉ / 7llm-statsAuto-déclaré
MathVision88,0 %6ᵉ / 32llm-statsAuto-déclaré
HMMT Feb 2687,8 %7ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench v687,1 %7ᵉ / 53llm-statsAuto-déclaré
MLVU86,7 %3ᵉ / 10llm-statsAuto-déclaré
MMMU86,0 %1ᵉ / 61llm-statsAuto-déclaré
RealWorldQA85,4 %4ᵉ / 25llm-statsAuto-déclaré
Include85,1 %4ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX84,7 %3ᵉ / 32llm-statsAuto-déclaré
WMT24++84,3 %5ᵉ / 23llm-statsAuto-déclaré
Video-MME84,2 %8ᵉ / 17llm-statsAuto-déclaré
VideoMMMU84,0 %10ᵉ / 26llm-statsAuto-déclaré
IMO-AnswerBench83,8 %10ᵉ / 19llm-statsAuto-déclaré
CC-OCR83,4 %1ᵉ / 18llm-statsAuto-déclaré
MMStar83,3 %1ᵉ / 22llm-statsAuto-déclaré
CharXiv-R81,5 %15ᵉ / 45llm-statsAuto-déclaré
MMMU-Pro78,8 %16ᵉ / 64llm-statsAuto-déclaré
SWE-Bench Verified78,8 %18ᵉ / 102llm-statsAuto-déclaré
PolyMATH77,4 %3ᵉ / 23llm-statsAuto-déclaré
WideSearch74,3 %4ᵉ / 9llm-statsAuto-déclaré
IFBench74,2 %10ᵉ / 27llm-statsAuto-déclaré
MCP Atlas74,1 %14ᵉ / 30llm-statsAuto-déclaré
SWE-bench Multilingual73,8 %11ᵉ / 34llm-statsAuto-déclaré
SuperGPQA71,6 %2ᵉ / 34llm-statsAuto-déclaré
LiveBench70,9 %28ᵉ / 38llm-statsn.d.
TAU3-Bench70,7 %2ᵉ / 5llm-statsAuto-déclaré
AA-LCR68,3 %5ᵉ / 15llm-statsAuto-déclaré
ScreenSpot Pro68,2 %10ᵉ / 23llm-statsAuto-déclaré
SimpleVQA67,3 %7ᵉ / 13llm-statsAuto-déclaré
ERQA65,7 %4ᵉ / 22llm-statsAuto-déclaré
OSWorld-Verified62,5 %15ᵉ / 19llm-statsAuto-déclaré
LongBench v262,0 %2ᵉ / 15llm-statsAuto-déclaré
MMLongBench-Doc62,0 %1ᵉ / 5llm-statsAuto-déclaré
Terminal-Bench 2.061,6 %19ᵉ / 49llm-statsAuto-déclaré
TIR-Bench61,6 %1ᵉ / 4llm-statsAuto-déclaré
Claw-Eval58,7 %11ᵉ / 13llm-statsAuto-déclaré
NOVA-6357,9 %6ᵉ / 11llm-statsAuto-déclaré
SWE-Bench Pro56,6 %24ᵉ / 41llm-statsAuto-déclaré
ODinW51,8 %1ᵉ / 16llm-statsAuto-déclaré
MCP-Mark48,2 %5ᵉ / 8llm-statsAuto-déclaré
SkillsBench45,7 %5ᵉ / 6llm-statsAuto-déclaré
VITA-Bench44,3 %4ᵉ / 10llm-statsAuto-déclaré
DeepPlanning41,5 %2ᵉ / 9llm-statsAuto-déclaré
Finance Agent v240,8 %16ᵉ / 26llm-statsn.d.
Toolathlon39,8 %24ᵉ / 30llm-statsAuto-déclaré
GDPval-AA38,7 %27ᵉ / 39llm-statsn.d.
NL2Repo37,9 %10ᵉ / 12llm-statsAuto-déclaré
Humanity's Last Exam28,8 %42ᵉ / 89llm-statsAuto-déclaré
FrontierSWE22,0 %14ᵉ / 14llm-statsn.d.

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Grok Build 0.1 061639.8
▶ Qwen3.6 Plus39.6
Nemotron 3 Ultra 550B A…37.8

Code Index

▶ Qwen3.6 Plus54.5
Grok Build 0.1 061651.5

Classements Arena (Elo)

Arena Image-to-Code · 31 modèles classés

RangModèleElo
1ᵉClaude Fable 51627
2ᵉClaude Opus 4.71581
3ᵉClaude Opus 4.71567
15ᵉGemini 3.1 Pro Preview1482
16ᵉMiniMax M31481
17ᵉQwen3.6 Plus1473
18ᵉGemini 3 Flash1457
19ᵉGemini 3 Pro1453

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
27ᵉKimi K2.7 Code1470
28ᵉClaude Opus 4.51466
29ᵉQwen3.6 Plus1459
30ᵉDeepSeek V4 Pro1459
31ᵉGPT-4.51457

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
60ᵉMiniMax M31445
61ᵉOpenAI: GPT-4.5 (Preview)1445
62ᵉQwen3.6 Plus1443
63ᵉChatGPT-4o Latest1443
64ᵉGrok 4.31442

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,325 $1,95 $n.d.
together0,5 $3 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 84 % en dessous de la moyenne des LLM similaires, et 16,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût par exécution agentique — PinchBench (147 tâches)11,86 $
Durée d'exécution — PinchBench4 h 57 min
Indice valeur/coût — PinchBench12,32

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. Qwen3.6 Plus obtient ses résultats les plus convaincants en mathématiques avancées, avec de solides performances sur OTIS Mock AIME 2024-2025 (olympiades de niveau lycée) et GPQA diamond (questions scientifiques de niveau doctorat). À sa sortie, son score sur GPQA diamond le plaçait dans le top 22% des LLM de sa génération. La programmation constitue un autre point fort relatif : le modèle se classe dans la première moitié sur LiveBench Coding et dans Arena code. Son tarif d’entrée de 0,325 $ par million de tokens, associé à une sortie facturée 1,95 $, rend l’exploitation de son contexte d’un million de tokens particulièrement économique.

Limites et points d’attention. Le profil reste moins convaincant en raisonnement général et en compréhension du langage, où les classements LiveBench se situent dans le bas du tableau évalué. Le résultat en mathématiques LiveBench est également en retrait par rapport aux scores obtenus sur OTIS Mock AIME et GPQA diamond, ce qui révèle des performances variables selon les protocoles. Dans les arènes, Qwen3.6 Plus reste éloigné des premières places, notamment en texte, tandis que l’image-to-code se situe au milieu du classement. Son Agentic Index est plus faible que son Code Index, ce qui limite son positionnement parmi les systèmes orientés agents. Le modèle convient surtout aux traitements volumineux, au code et aux tâches scientifiques sensibles au coût.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).