Qwen3.5-35B-A3B
Publié par Qwen le 24 février 2026, Qwen3.5-35B-A3B est un modèle de langage causal open-weights sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated Delta Networks, attention gated et Mixture-of-Experts sparse, avec 35 milliards de paramètres au…
Publié par Qwen le 24 février 2026, Qwen3.5-35B-A3B est un modèle de langage causal open-weights sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated Delta Networks, attention gated et Mixture-of-Experts sparse, avec 35 milliards de paramètres au total, dont 3 milliards activés.
Le modèle intègre un encodeur vision et couvre 201 langues et dialectes. Sa fenêtre de contexte native atteint 262 144 tokens et peut être étendue jusqu’à 1 010 000 tokens. Les poids et configurations sont proposés au format Hugging Face Transformers, avec une compatibilité annoncée pour vLLM, SGLang et KTransformers.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 24 février 2026 |
| Multimodal | oui |
| Paramètres | 35 milliards |
| Paramètres actifs | 3 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 29.3 | 66ᵉ / 137 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| CountBench | 97,8 % | 1ᵉ / 6 | llm-stats | Auto-déclaré |
| VLMsAreBlind | 97,0 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| MMLU-Redux | 93,3 % | 11ᵉ / 48 | llm-stats | Auto-déclaré |
| V* | 92,7 % | 6ᵉ / 7 | llm-stats | Auto-déclaré |
| AI2D | 92,6 % | 9ᵉ / 32 | llm-stats | Auto-déclaré |
| IFEval | 91,9 % | 11ᵉ / 65 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 91,5 % | 5ᵉ / 18 | llm-stats | Auto-déclaré |
| OCRBench | 91,0 % | 4ᵉ / 22 | llm-stats | Auto-déclaré |
| C-Eval | 90,2 % | 8ᵉ / 18 | llm-stats | Auto-déclaré |
| OmniDocBench 1.5 | 89,3 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| HMMT25 | 89,2 % | 8ᵉ / 25 | llm-stats | Auto-déclaré |
| RefCOCO-avg | 89,2 % | 7ᵉ / 7 | llm-stats | Auto-déclaré |
| HMMT 2025 | 89,0 % | 19ᵉ / 33 | llm-stats | Auto-déclaré |
| Global PIQA | 86,6 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| MAXIFE | 86,6 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 86,6 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| MathVista-Mini | 86,2 % | 6ᵉ / 23 | llm-stats | Auto-déclaré |
| MLVU | 85,6 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| MMLU-Pro | 85,3 % | 14ᵉ / 125 | llm-stats | Auto-déclaré |
| MMMLU | 85,2 % | 32ᵉ / 49 | llm-stats | Auto-déclaré |
| DynaMath | 85,0 % | 5ᵉ / 7 | llm-stats | Auto-déclaré |
| GPQA | 84,2 % | 53ᵉ / 219 | llm-stats | Auto-déclaré |
| RealWorldQA | 84,1 % | 7ᵉ / 25 | llm-stats | Auto-déclaré |
| MathVision | 83,9 % | 11ᵉ / 32 | llm-stats | Auto-déclaré |
| EmbSpatialBench | 83,1 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 82,5 % | 3ᵉ / 10 | llm-stats | Auto-déclaré |
| CodeForces | 82,2 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| MMStar | 81,9 % | 3ᵉ / 22 | llm-stats | Auto-déclaré |
| MMMU | 81,4 % | 12ᵉ / 61 | llm-stats | Auto-déclaré |
| t2-bench | 81,2 % | 8ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-ProX | 81,0 % | 8ᵉ / 32 | llm-stats | Auto-déclaré |
| CC-OCR | 80,7 % | 8ᵉ / 18 | llm-stats | Auto-déclaré |
| VideoMMMU | 80,4 % | 16ᵉ / 26 | llm-stats | Auto-déclaré |
| Include | 79,7 % | 11ᵉ / 31 | llm-stats | Auto-déclaré |
| LingoQA | 79,2 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| SlakeVQA | 78,7 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| CharXiv-R | 77,5 % | 24ᵉ / 45 | llm-stats | Auto-déclaré |
| WMT24++ | 76,3 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| MMMU-Pro | 75,1 % | 32ᵉ / 64 | llm-stats | Auto-déclaré |
| MVBench | 74,8 % | 3ᵉ / 17 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 74,6 % | 24ᵉ / 53 | llm-stats | Auto-déclaré |
| MMVU | 72,3 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| LVBench | 71,4 % | 7ᵉ / 23 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 71,1 % | 1ᵉ / 8 | llm-stats | Auto-déclaré |
| IFBench | 70,2 % | 15ᵉ / 27 | llm-stats | Auto-déclaré |
| BrowseComp-zh | 69,5 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| SWE-Bench Verified | 69,2 % | 62ᵉ / 102 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 68,6 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| Hallusion Bench | 67,9 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| BFCL-V4 | 67,3 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| ERQA | 64,8 % | 6ᵉ / 22 | llm-stats | Auto-déclaré |
| PolyMATH | 64,4 % | 7ᵉ / 23 | llm-stats | Auto-déclaré |
| RefSpatialBench | 63,5 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
| SuperGPQA | 63,4 % | 14ᵉ / 34 | llm-stats | Auto-déclaré |
| PMC-VQA | 62,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| MedXpertQA | 61,4 % | 4ᵉ / 12 | llm-stats | Auto-déclaré |
| BrowseComp | 61,0 % | 33ᵉ / 57 | llm-stats | Auto-déclaré |
| Multi-Challenge | 60,0 % | 11ᵉ / 28 | llm-stats | Auto-déclaré |
| MMLongBench-Doc | 59,5 % | 3ᵉ / 5 | llm-stats | Auto-déclaré |
| LongBench v2 | 59,0 % | 10ᵉ / 15 | llm-stats | Auto-déclaré |
| AA-LCR | 58,5 % | 11ᵉ / 15 | llm-stats | Auto-déclaré |
| SimpleVQA | 58,3 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| FullStackBench en | 58,1 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| NOVA-63 | 57,1 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| WideSearch | 57,1 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| TIR-Bench | 55,5 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| FullStackBench zh | 55,0 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| OSWorld-Verified | 54,5 % | 18ᵉ / 19 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 47,4 % | 24ᵉ / 89 | llm-stats | Auto-déclaré |
| ODinW | 42,6 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| Seal-0 | 41,4 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
| Terminal-Bench 2.0 | 40,5 % | 45ᵉ / 49 | llm-stats | Auto-déclaré |
| BabyVision | 38,4 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| OJBench | 36,0 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| ZEROBench-Sub | 34,1 % | 4ᵉ / 5 | llm-stats | Auto-déclaré |
| SUNRGBD | 33,4 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| VITA-Bench | 31,9 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| DeepPlanning | 22,8 % | 6ᵉ / 9 | llm-stats | Auto-déclaré |
| Nuscene | 14,6 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| Hypersim | 13,1 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| ZEROBench | 8,0 % | 8ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 131ᵉ | Qwen: Qwen3.5-Flash | 1397 |
| 132ᵉ | DeepSeek-V3 0324 | 1396 |
| 133ᵉ | Qwen3.5-35B-A3B | 1396 |
| 134ᵉ | Qwen3 VL 235B A22B Thinking | 1395 |
| 135ᵉ | hunyuan-vision-1.5-thinking | 1395 |
Arena Code · 99 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Kimi K3 | 1679 |
| 2ᵉ | Claude Fable 5 | 1631 |
| 3ᵉ | GPT-5.6 Sol | 1618 |
| ⋯ | ⋯ | |
| 84ᵉ | KAT-Coder-Pro-V1 | 1259 |
| 85ᵉ | Gemini 3.1 Flash-Lite | 1253 |
| 86ᵉ | Qwen3.5-35B-A3B | 1250 |
| 87ᵉ | Arcee AI: Trinity Large Thinking | 1243 |
| 88ᵉ | GPT-5.1 Codex Mini | 1240 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,14 $ | 1 $ | 0,05 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 93 % en dessous de la moyenne des LLM similaires, et 39,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,41 $ |
| Latence moyenne par benchmark — Benchable | 26 min 48 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen3.5-35B-A3B se distingue surtout en classification d’e-mails, où il se place dans le premier dixième du classement Benchable. Son résultat au test Hallucinations est également élevé, tandis que le suivi d’instructions se situe davantage dans le milieu de tableau. À sa sortie, le modèle appartenait au top 18% des LLM de sa génération sur GPQA, ce qui signale un niveau compétitif sur ce test à son époque. Son autre avantage majeur est économique : sa tarification se situe 93% sous la moyenne des LLM similaires et environ 39,3 fois sous celle des modèles frontière.
Limites et points d'attention. Les résultats Benchable sont très faibles en connaissances générales, en programmation et en raisonnement, avec un score nul sur chacun de ces tests. L’Intelligence Index place aussi le modèle dans la moitié basse du panel. Les classements Arena confirment ce retrait relatif, particulièrement en code, où Qwen3.5-35B-A3B figure près du bas du tableau. Il convient donc surtout aux déploiements économiques centrés sur la classification d’e-mails, le traitement de longs contextes, les contenus multilingues ou les entrées visuelles, plutôt qu’aux tâches exigeantes de raisonnement, de connaissances générales ou de développement logiciel.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).