Qwen3.5-122B-A10B
Publié par Qwen le 24 février 2026, Qwen3.5-122B-A10B est un LLM multimodal chinois à poids ouverts sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated DeltaNet, Gated Attention et Mixture-of-Experts, avec 122 milliards de paramètres, dont 10…
Publié par Qwen le 24 février 2026, Qwen3.5-122B-A10B est un LLM multimodal chinois à poids ouverts sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated DeltaNet, Gated Attention et Mixture-of-Experts, avec 122 milliards de paramètres, dont 10 milliards activés.
Le modèle combine langage causal et encodeur vision, prend en charge 201 langues et dialectes, et offre un contexte natif de 262 144 tokens, extensible jusqu’à 1 010 000 tokens. Compatible avec Transformers, vLLM, SGLang et KTransformers, il se distingue aussi par un tarif très économique, inférieur de 87% à la moyenne des LLM similaires.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 24 février 2026 |
| Multimodal | oui |
| Paramètres | 122 milliards |
| Paramètres actifs | 10 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 32.3 | 51ᵉ / 137 |
| Code Index | 45.7 | 37ᵉ / 74 |
| Agentic Index | 20.7 | 39ᵉ / 68 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CountBench | 97,0 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| VLMsAreBlind | 96,7 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| MMLU-Redux | 94,0 % | 6ᵉ / 48 | llm-stats | Auto-déclaré |
| IFEval | 93,4 % | 6ᵉ / 65 | llm-stats | Auto-déclaré |
| AI2D | 93,3 % | 5ᵉ / 32 | llm-stats | Auto-déclaré |
| V* | 93,2 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 92,8 % | 1ᵉ / 18 | llm-stats | Auto-déclaré |
| OCRBench | 92,1 % | 2ᵉ / 22 | llm-stats | Auto-déclaré |
| C-Eval | 91,9 % | 4ᵉ / 18 | llm-stats | Auto-déclaré |
| HMMT 2025 | 91,4 % | 15ᵉ / 33 | llm-stats | Auto-déclaré |
| RefCOCO-avg | 91,3 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| HMMT25 | 90,3 % | 5ᵉ / 25 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 89,8 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| Global PIQA | 88,4 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| MAXIFE | 87,9 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| MathVista-Mini | 87,4 % | 3ᵉ / 23 | llm-stats | Auto-déclaré |
| MLVU | 87,3 % | 2ᵉ / 10 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 87,3 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| MMLU-Pro | 86,7 % | 10ᵉ / 125 | llm-stats | Auto-déclaré |
| MMMLU | 86,7 % | 21ᵉ / 49 | llm-stats | Auto-déclaré |
| GPQA | 86,6 % | 38ᵉ / 219 | llm-stats | Auto-déclaré |
| MathVision | 86,2 % | 7ᵉ / 32 | llm-stats | Auto-déclaré |
| DynaMath | 85,9 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| CodeForces | 85,1 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| RealWorldQA | 85,1 % | 6ᵉ / 25 | llm-stats | Auto-déclaré |
| EmbSpatialBench | 83,9 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| MMMU | 83,9 % | 5ᵉ / 61 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 83,9 % | 1ᵉ / 10 | llm-stats | Auto-déclaré |
| MMStar | 82,9 % | 2ᵉ / 22 | llm-stats | Auto-déclaré |
| Include | 82,8 % | 6ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 82,2 % | 6ᵉ / 32 | llm-stats | Auto-déclaré |
| VideoMMMU | 82,0 % | 15ᵉ / 26 | llm-stats | Auto-déclaré |
| CC-OCR | 81,8 % | 4ᵉ / 18 | llm-stats | Auto-déclaré |
| SlakeVQA | 81,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| LingoQA | 80,8 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| t2-bench | 79,5 % | 13ᵉ / 23 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 78,9 % | 22ᵉ / 53 | llm-stats | Auto-déclaré |
| WMT24++ | 78,3 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| CharXiv-R | 77,2 % | 27ᵉ / 45 | llm-stats | Auto-déclaré |
| MMMU-Pro | 76,9 % | 23ᵉ / 64 | llm-stats | Auto-déclaré |
| MVBench | 76,6 % | 1ᵉ / 17 | llm-stats | Auto-déclaré |
| IFBench | 76,1 % | 8ᵉ / 27 | llm-stats | Auto-déclaré |
| MMVU | 74,7 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| LVBench | 74,4 % | 5ᵉ / 23 | llm-stats | Auto-déclaré |
| BFCL-V4 | 72,2 % | 4ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 72,0 % | 51ᵉ / 102 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 70,4 % | 6ᵉ / 23 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 69,9 % | 2ᵉ / 13 | llm-stats | Auto-déclaré |
| RefSpatialBench | 69,3 % | 3ᵉ / 6 | llm-stats | Auto-déclaré |
| PolyMATH | 68,9 % | 6ᵉ / 23 | llm-stats | Auto-déclaré |
| Hallusion Bench | 67,6 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| MedXpertQA | 67,3 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| SuperGPQA | 67,1 % | 7ᵉ / 34 | llm-stats | Auto-déclaré |
| AA-LCR | 66,9 % | 6ᵉ / 15 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 66,4 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| BrowseComp | 63,8 % | 31ᵉ / 57 | llm-stats | Auto-déclaré |
| PMC-VQA | 63,3 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| FullStackBench en | 62,6 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| ERQA | 62,0 % | 10ᵉ / 22 | llm-stats | Auto-déclaré |
| SimpleVQA | 61,7 % | 8ᵉ / 13 | llm-stats | Auto-déclaré |
| Multi-Challenge | 61,5 % | 8ᵉ / 28 | llm-stats | Auto-déclaré |
| WideSearch | 60,5 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
| LongBench v2 | 60,2 % | 9ᵉ / 15 | llm-stats | Auto-déclaré |
| MMLongBench-Doc | 59,0 % | 4ᵉ / 5 | llm-stats | Auto-déclaré |
| FullStackBench zh | 58,7 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| NOVA-63 | 58,6 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 58,0 % | 16ᵉ / 19 | llm-stats | Auto-déclaré |
| TIR-Bench | 53,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 49,4 % | 36ᵉ / 49 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 47,5 % | 23ᵉ / 89 | llm-stats | Auto-déclaré |
| ODinW | 44,5 % | 9ᵉ / 16 | llm-stats | Auto-déclaré |
| Seal-0 | 44,1 % | 5ᵉ / 6 | llm-stats | Auto-déclaré |
| BabyVision | 40,2 % | 8ᵉ / 9 | llm-stats | Auto-déclaré |
| OJBench | 39,5 % | 4ᵉ / 9 | llm-stats | Auto-déclaré |
| SUNRGBD | 36,2 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| ZEROBench-Sub | 36,2 % | 1ᵉ / 5 | llm-stats | Auto-déclaré |
| VITA-Bench | 33,6 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| GDPval-AA | 32,8 % | 33ᵉ / 39 | llm-stats | n.d. |
| DeepPlanning | 24,1 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| Nuscene | 15,4 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| Hypersim | 12,7 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| ZEROBench | 9,0 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Code Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 102ᵉ | DeepSeek-V3.1 | 1418 |
| 103ᵉ | kimi-k2-0711-preview | 1417 |
| 104ᵉ | Qwen3.5-122B-A10B | 1417 |
| 105ᵉ | deepseek-v3.1-thinking | 1417 |
| 106ᵉ | MiniMax M2.7 | 1417 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 62ᵉ | DeepSeek-V3.2 (Thinking) | 1368 |
| 63ᵉ | Gemma 4 31B | 1367 |
| 64ᵉ | Qwen3.5-122B-A10B | 1364 |
| 65ᵉ | Tencent: Hy3 preview | 1361 |
| 66ᵉ | Gemma 4 26B-A4B | 1361 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 43ᵉ | GLM-5V-Turbo | 1231 |
| 44ᵉ | GPT-5.2 | 1230 |
| 45ᵉ | Qwen3.5-122B-A10B | 1228 |
| 46ᵉ | OpenAI: GPT-4.5 (Preview) | 1225 |
| 47ᵉ | gpt-5-chat-2025-08-07 | 1225 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| SiliconFlow | 0,26 $ | 2,08 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,45 $ |
| Latence moyenne par benchmark — Benchable | 21 min 30 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Entraînement & empreinte
| Indicateur | Valeur |
|---|---|
| Pays | China |
Notre analyse
Forces. À sa sortie, Qwen3.5-122B-A10B se classait dans le top 12% des LLM de sa génération sur GPQA, ce qui le situait favorablement sur ce test. Les évaluations Benchable montrent aussi de bons résultats en Hallucinations et en Email Classification, ainsi qu’un suivi d’instructions solide. Son Code Index le place dans la première moitié des modèles évalués, tandis que son classement Arena vision se situe dans le premier tiers. L’activation de 10 milliards de paramètres sur 122 milliards au total caractérise une architecture visant à limiter les ressources mobilisées à chaque traitement. Son coût constitue un autre avantage net, environ 21,2 fois inférieur à celui des modèles frontière.
Limites et points d'attention. Les résultats sont très inégaux selon les protocoles. Les évaluations Benchable Baseline attribuent un score nul en General Knowledge, Coding et Reasoning, malgré un positionnement plus favorable dans les indices agrégés. L’Intelligence Index reste hors du premier tiers, l’Agentic Index se situe dans la seconde moitié, et les classements Arena placent le modèle autour du milieu de tableau en texte et plus bas en code. La très longue extension de contexte dépasse la fenêtre native et doit donc être distinguée de celle-ci. Le modèle cible surtout les déploiements multilingues, multimodaux et sensibles au coût, avec validation préalable sur les tâches de connaissance, de raisonnement et de programmation.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).