Qwen3.6 Plus
Qwen3.6 Plus est un LLM propriétaire de l’éditeur chinois Qwen, lancé le 31 mars 2026. Sa principale caractéristique est une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte ou de code au sein d’une même requête.
Qwen3.6 Plus est un LLM propriétaire de l’éditeur chinois Qwen, lancé le 31 mars 2026. Sa principale caractéristique est une fenêtre de contexte de 1 000 000 tokens, adaptée au traitement de très grands volumes de texte ou de code au sein d’une même requête.
Le modèle associe ce contexte étendu à un positionnement très économique. Sa tarification se situe 84% sous la moyenne des LLM similaires et environ 16,9 fois sous celle des modèles frontière. Les poids ne sont pas ouverts, ce qui le distingue des modèles distribués sous licence ouverte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🔒 Propriétaire |
| Date de sortie | 31 mars 2026 |
| Multimodal | oui |
| Fenêtre de contexte | 1 000 000 tokens (≈ 1,0 M) |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 39.6 | 25ᵉ / 137 |
| Code Index | 54.5 | 28ᵉ / 74 |
| Agentic Index | 27.6 | 25ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CountBench | 97,6 % | 4ᵉ / 6 | llm-stats | Auto-déclaré |
| V* | 96,9 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| HMMT 2025 | 96,7 % | 5ᵉ / 33 | llm-stats | Auto-déclaré |
| AIME 2026 | 95,3 % | 3ᵉ / 17 | llm-stats | Auto-déclaré |
| HMMT25 | 94,6 % | 2ᵉ / 25 | llm-stats | Auto-déclaré |
| MMLU-Redux | 94,5 % | 3ᵉ / 48 | llm-stats | Auto-déclaré |
| AI2D | 94,4 % | 2ᵉ / 32 | llm-stats | Auto-déclaré |
| IFEval | 94,3 % | 3ᵉ / 65 | llm-stats | Auto-déclaré |
| RefCOCO-avg | 93,5 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| C-Eval | 93,3 % | 1ᵉ / 18 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 91,2 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| GPQA | 90,4 % | 18ᵉ / 219 | llm-stats | Auto-déclaré |
| Global PIQA | 89,8 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMLU | 89,5 % | 10ᵉ / 49 | llm-stats | Auto-déclaré |
| MMLU-Pro | 88,5 % | 2ᵉ / 125 | llm-stats | Auto-déclaré |
| MAXIFE | 88,2 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| DynaMath | 88,0 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| MathVision | 88,0 % | 6ᵉ / 32 | llm-stats | Auto-déclaré |
| HMMT Feb 26 | 87,8 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 87,1 % | 7ᵉ / 53 | llm-stats | Auto-déclaré |
| MLVU | 86,7 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| MMMU | 86,0 % | 1ᵉ / 61 | llm-stats | Auto-déclaré |
| RealWorldQA | 85,4 % | 4ᵉ / 25 | llm-stats | Auto-déclaré |
| Include | 85,1 % | 4ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 84,7 % | 3ᵉ / 32 | llm-stats | Auto-déclaré |
| WMT24++ | 84,3 % | 5ᵉ / 23 | llm-stats | Auto-déclaré |
| Video-MME | 84,2 % | 8ᵉ / 17 | llm-stats | Auto-déclaré |
| VideoMMMU | 84,0 % | 10ᵉ / 26 | llm-stats | Auto-déclaré |
| IMO-AnswerBench | 83,8 % | 10ᵉ / 19 | llm-stats | Auto-déclaré |
| CC-OCR | 83,4 % | 1ᵉ / 18 | llm-stats | Auto-déclaré |
| MMStar | 83,3 % | 1ᵉ / 22 | llm-stats | Auto-déclaré |
| CharXiv-R | 81,5 % | 15ᵉ / 45 | llm-stats | Auto-déclaré |
| MMMU-Pro | 78,8 % | 16ᵉ / 64 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 78,8 % | 18ᵉ / 102 | llm-stats | Auto-déclaré |
| PolyMATH | 77,4 % | 3ᵉ / 23 | llm-stats | Auto-déclaré |
| WideSearch | 74,3 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| IFBench | 74,2 % | 10ᵉ / 27 | llm-stats | Auto-déclaré |
| MCP Atlas | 74,1 % | 14ᵉ / 30 | llm-stats | Auto-déclaré |
| SWE-bench Multilingual | 73,8 % | 11ᵉ / 34 | llm-stats | Auto-déclaré |
| SuperGPQA | 71,6 % | 2ᵉ / 34 | llm-stats | Auto-déclaré |
| LiveBench | 70,9 % | 28ᵉ / 38 | llm-stats | n.d. |
| TAU3-Bench | 70,7 % | 2ᵉ / 5 | llm-stats | Auto-déclaré |
| AA-LCR | 68,3 % | 5ᵉ / 15 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 68,2 % | 10ᵉ / 23 | llm-stats | Auto-déclaré |
| SimpleVQA | 67,3 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| ERQA | 65,7 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 62,5 % | 15ᵉ / 19 | llm-stats | Auto-déclaré |
| LongBench v2 | 62,0 % | 2ᵉ / 15 | llm-stats | Auto-déclaré |
| MMLongBench-Doc | 62,0 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 61,6 % | 19ᵉ / 49 | llm-stats | Auto-déclaré |
| TIR-Bench | 61,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Claw-Eval | 58,7 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| NOVA-63 | 57,9 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| SWE-Bench Pro | 56,6 % | 24ᵉ / 41 | llm-stats | Auto-déclaré |
| ODinW | 51,8 % | 1ᵉ / 16 | llm-stats | Auto-déclaré |
| MCP-Mark | 48,2 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| SkillsBench | 45,7 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| VITA-Bench | 44,3 % | 4ᵉ / 10 | llm-stats | Auto-déclaré |
| DeepPlanning | 41,5 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| Finance Agent v2 | 40,8 % | 16ᵉ / 26 | llm-stats | n.d. |
| Toolathlon | 39,8 % | 24ᵉ / 30 | llm-stats | Auto-déclaré |
| GDPval-AA | 38,7 % | 27ᵉ / 39 | llm-stats | n.d. |
| NL2Repo | 37,9 % | 10ᵉ / 12 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 28,8 % | 42ᵉ / 89 | llm-stats | Auto-déclaré |
| FrontierSWE | 22,0 % | 14ᵉ / 14 | llm-stats | n.d. |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Image-to-Code · 31 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1627 |
| 2ᵉ | Claude Opus 4.7 | 1581 |
| 3ᵉ | Claude Opus 4.7 | 1567 |
| ⋯ | ⋯ | |
| 15ᵉ | Gemini 3.1 Pro Preview | 1482 |
| 16ᵉ | MiniMax M3 | 1481 |
| 17ᵉ | Qwen3.6 Plus | 1473 |
| 18ᵉ | Gemini 3 Flash | 1457 |
| 19ᵉ | Gemini 3 Pro | 1453 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 27ᵉ | Kimi K2.7 Code | 1470 |
| 28ᵉ | Claude Opus 4.5 | 1466 |
| 29ᵉ | Qwen3.6 Plus | 1459 |
| 30ᵉ | DeepSeek V4 Pro | 1459 |
| 31ᵉ | GPT-4.5 | 1457 |
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 60ᵉ | MiniMax M3 | 1445 |
| 61ᵉ | OpenAI: GPT-4.5 (Preview) | 1445 |
| 62ᵉ | Qwen3.6 Plus | 1443 |
| 63ᵉ | ChatGPT-4o Latest | 1443 |
| 64ᵉ | Grok 4.3 | 1442 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,325 $ | 1,95 $ | n.d. |
| together | 0,5 $ | 3 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 84 % en dessous de la moyenne des LLM similaires, et 16,9 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût par exécution agentique — PinchBench (147 tâches) | 11,86 $ |
| Durée d'exécution — PinchBench | 4 h 57 min |
| Indice valeur/coût — PinchBench | 12,32 |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. Qwen3.6 Plus obtient ses résultats les plus convaincants en mathématiques avancées, avec de solides performances sur OTIS Mock AIME 2024-2025 (olympiades de niveau lycée) et GPQA diamond (questions scientifiques de niveau doctorat). À sa sortie, son score sur GPQA diamond le plaçait dans le top 22% des LLM de sa génération. La programmation constitue un autre point fort relatif : le modèle se classe dans la première moitié sur LiveBench Coding et dans Arena code. Son tarif d’entrée de 0,325 $ par million de tokens, associé à une sortie facturée 1,95 $, rend l’exploitation de son contexte d’un million de tokens particulièrement économique.
Limites et points d’attention. Le profil reste moins convaincant en raisonnement général et en compréhension du langage, où les classements LiveBench se situent dans le bas du tableau évalué. Le résultat en mathématiques LiveBench est également en retrait par rapport aux scores obtenus sur OTIS Mock AIME et GPQA diamond, ce qui révèle des performances variables selon les protocoles. Dans les arènes, Qwen3.6 Plus reste éloigné des premières places, notamment en texte, tandis que l’image-to-code se situe au milieu du classement. Son Agentic Index est plus faible que son Code Index, ce qui limite son positionnement parmi les systèmes orientés agents. Le modèle convient surtout aux traitements volumineux, au code et aux tâches scientifiques sensibles au coût.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · LiveBench (livebench.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · PinchBench (pinchbench.com).