Qwen3.5-122B-A10B

Publié par Qwen le 24 février 2026, Qwen3.5-122B-A10B est un LLM multimodal chinois à poids ouverts sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated DeltaNet, Gated Attention et Mixture-of-Experts, avec 122 milliards de paramètres, dont 10…

Publié par Qwen le 24 février 2026, Qwen3.5-122B-A10B est un LLM multimodal chinois à poids ouverts sous licence Apache 2.0, utilisable commercialement. Son architecture hybride associe Gated DeltaNet, Gated Attention et Mixture-of-Experts, avec 122 milliards de paramètres, dont 10 milliards activés.

Le modèle combine langage causal et encodeur vision, prend en charge 201 langues et dialectes, et offre un contexte natif de 262 144 tokens, extensible jusqu’à 1 010 000 tokens. Compatible avec Transformers, vLLM, SGLang et KTransformers, il se distingue aussi par un tarif très économique, inférieur de 87% à la moyenne des LLM similaires.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie24 février 2026
Multimodaloui
Paramètres122 milliards
Paramètres actifs10 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index32.351ᵉ / 137
Code Index45.737ᵉ / 74
Agentic Index20.739ᵉ / 68

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
CountBench97,0 %5ᵉ / 6llm-statsAuto-déclaré
VLMsAreBlind96,7 %4ᵉ / 4llm-statsAuto-déclaré
MMLU-Redux94,0 %6ᵉ / 48llm-statsAuto-déclaré
IFEval93,4 %6ᵉ / 65llm-statsAuto-déclaré
AI2D93,3 %5ᵉ / 32llm-statsAuto-déclaré
V*93,2 %5ᵉ / 7llm-statsAuto-déclaré
MMBench-V1.192,8 %1ᵉ / 18llm-statsAuto-déclaré
OCRBench92,1 %2ᵉ / 22llm-statsAuto-déclaré
C-Eval91,9 %4ᵉ / 18llm-statsAuto-déclaré
HMMT 202591,4 %15ᵉ / 33llm-statsAuto-déclaré
RefCOCO-avg91,3 %5ᵉ / 7llm-statsAuto-déclaré
HMMT2590,3 %5ᵉ / 25llm-statsAuto-déclaré
OmniDocBench 1.589,8 %5ᵉ / 13llm-statsAuto-déclaré
Global PIQA88,4 %7ᵉ / 13llm-statsAuto-déclaré
MAXIFE87,9 %6ᵉ / 11llm-statsAuto-déclaré
MathVista-Mini87,4 %3ᵉ / 23llm-statsAuto-déclaré
MLVU87,3 %2ᵉ / 10llm-statsAuto-déclaré
VideoMME w sub.87,3 %2ᵉ / 9llm-statsAuto-déclaré
MMLU-Pro86,7 %10ᵉ / 125llm-statsAuto-déclaré
MMMLU86,7 %21ᵉ / 49llm-statsAuto-déclaré
GPQA86,6 %38ᵉ / 219llm-statsAuto-déclaré
MathVision86,2 %7ᵉ / 32llm-statsAuto-déclaré
DynaMath85,9 %3ᵉ / 7llm-statsAuto-déclaré
CodeForces85,1 %4ᵉ / 16llm-statsAuto-déclaré
RealWorldQA85,1 %6ᵉ / 25llm-statsAuto-déclaré
EmbSpatialBench83,9 %5ᵉ / 8llm-statsAuto-déclaré
MMMU83,9 %5ᵉ / 61llm-statsAuto-déclaré
VideoMME w/o sub.83,9 %1ᵉ / 10llm-statsAuto-déclaré
MMStar82,9 %2ᵉ / 22llm-statsAuto-déclaré
Include82,8 %6ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX82,2 %6ᵉ / 32llm-statsAuto-déclaré
VideoMMMU82,0 %15ᵉ / 26llm-statsAuto-déclaré
CC-OCR81,8 %4ᵉ / 18llm-statsAuto-déclaré
SlakeVQA81,6 %1ᵉ / 4llm-statsAuto-déclaré
LingoQA80,8 %3ᵉ / 4llm-statsAuto-déclaré
t2-bench79,5 %13ᵉ / 23llm-statsAuto-déclaré
LiveCodeBench v678,9 %22ᵉ / 53llm-statsAuto-déclaré
WMT24++78,3 %9ᵉ / 23llm-statsAuto-déclaré
CharXiv-R77,2 %27ᵉ / 45llm-statsAuto-déclaré
MMMU-Pro76,9 %23ᵉ / 64llm-statsAuto-déclaré
MVBench76,6 %1ᵉ / 17llm-statsAuto-déclaré
IFBench76,1 %8ᵉ / 27llm-statsAuto-déclaré
MMVU74,7 %2ᵉ / 4llm-statsAuto-déclaré
LVBench74,4 %5ᵉ / 23llm-statsAuto-déclaré
BFCL-V472,2 %4ᵉ / 13llm-statsAuto-déclaré
SWE-Bench Verified72,0 %51ᵉ / 102llm-statsAuto-déclaré
ScreenSpot Pro70,4 %6ᵉ / 23llm-statsAuto-déclaré
BrowseComp-zh69,9 %2ᵉ / 13llm-statsAuto-déclaré
RefSpatialBench69,3 %3ᵉ / 6llm-statsAuto-déclaré
PolyMATH68,9 %6ᵉ / 23llm-statsAuto-déclaré
Hallusion Bench67,6 %4ᵉ / 16llm-statsAuto-déclaré
MedXpertQA67,3 %2ᵉ / 12llm-statsAuto-déclaré
SuperGPQA67,1 %7ᵉ / 34llm-statsAuto-déclaré
AA-LCR66,9 %6ᵉ / 15llm-statsAuto-déclaré
AndroidWorld_SR66,4 %2ᵉ / 8llm-statsAuto-déclaré
BrowseComp63,8 %31ᵉ / 57llm-statsAuto-déclaré
PMC-VQA63,3 %1ᵉ / 3llm-statsAuto-déclaré
FullStackBench en62,6 %1ᵉ / 3llm-statsAuto-déclaré
ERQA62,0 %10ᵉ / 22llm-statsAuto-déclaré
SimpleVQA61,7 %8ᵉ / 13llm-statsAuto-déclaré
Multi-Challenge61,5 %8ᵉ / 28llm-statsAuto-déclaré
WideSearch60,5 %7ᵉ / 9llm-statsAuto-déclaré
LongBench v260,2 %9ᵉ / 15llm-statsAuto-déclaré
MMLongBench-Doc59,0 %4ᵉ / 5llm-statsAuto-déclaré
FullStackBench zh58,7 %1ᵉ / 3llm-statsAuto-déclaré
NOVA-6358,6 %4ᵉ / 11llm-statsAuto-déclaré
OSWorld-Verified58,0 %16ᵉ / 19llm-statsAuto-déclaré
TIR-Bench53,2 %4ᵉ / 4llm-statsAuto-déclaré
Terminal-Bench 2.049,4 %36ᵉ / 49llm-statsAuto-déclaré
Humanity's Last Exam47,5 %23ᵉ / 89llm-statsAuto-déclaré
ODinW44,5 %9ᵉ / 16llm-statsAuto-déclaré
Seal-044,1 %5ᵉ / 6llm-statsAuto-déclaré
BabyVision40,2 %8ᵉ / 9llm-statsAuto-déclaré
OJBench39,5 %4ᵉ / 9llm-statsAuto-déclaré
SUNRGBD36,2 %1ᵉ / 4llm-statsAuto-déclaré
ZEROBench-Sub36,2 %1ᵉ / 5llm-statsAuto-déclaré
VITA-Bench33,6 %7ᵉ / 10llm-statsAuto-déclaré
GDPval-AA32,8 %33ᵉ / 39llm-statsn.d.
DeepPlanning24,1 %5ᵉ / 9llm-statsAuto-déclaré
Nuscene15,4 %1ᵉ / 3llm-statsAuto-déclaré
Hypersim12,7 %3ᵉ / 4llm-statsAuto-déclaré
ZEROBench9,0 %7ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nemotron 3 Ultra 550B A…37.8
▶ Qwen3.5-122B-A10B32.3
Qwen3.5 397B A17B32.0

Code Index

▶ Qwen3.5-122B-A10B45.7
Qwen3.5 122B A10B43.3

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
102ᵉDeepSeek-V3.11418
103ᵉkimi-k2-0711-preview1417
104ᵉQwen3.5-122B-A10B1417
105ᵉdeepseek-v3.1-thinking1417
106ᵉMiniMax M2.71417

Arena Code · 99 modèles classés

RangModèleElo
1ᵉKimi K31679
2ᵉClaude Fable 51631
3ᵉGPT-5.6 Sol1618
62ᵉDeepSeek-V3.2 (Thinking)1368
63ᵉGemma 4 31B1367
64ᵉQwen3.5-122B-A10B1364
65ᵉTencent: Hy3 preview1361
66ᵉGemma 4 26B-A4B1361

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
43ᵉGLM-5V-Turbo1231
44ᵉGPT-5.21230
45ᵉQwen3.5-122B-A10B1228
46ᵉOpenAI: GPT-4.5 (Preview)1225
47ᵉgpt-5-chat-2025-08-071225

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
SiliconFlow0,26 $2,08 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,45 $
Latence moyenne par benchmark — Benchable21 min 30 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Entraînement & empreinte

IndicateurValeur
PaysChina

Notre analyse

Forces. À sa sortie, Qwen3.5-122B-A10B se classait dans le top 12% des LLM de sa génération sur GPQA, ce qui le situait favorablement sur ce test. Les évaluations Benchable montrent aussi de bons résultats en Hallucinations et en Email Classification, ainsi qu’un suivi d’instructions solide. Son Code Index le place dans la première moitié des modèles évalués, tandis que son classement Arena vision se situe dans le premier tiers. L’activation de 10 milliards de paramètres sur 122 milliards au total caractérise une architecture visant à limiter les ressources mobilisées à chaque traitement. Son coût constitue un autre avantage net, environ 21,2 fois inférieur à celui des modèles frontière.

Limites et points d'attention. Les résultats sont très inégaux selon les protocoles. Les évaluations Benchable Baseline attribuent un score nul en General Knowledge, Coding et Reasoning, malgré un positionnement plus favorable dans les indices agrégés. L’Intelligence Index reste hors du premier tiers, l’Agentic Index se situe dans la seconde moitié, et les classements Arena placent le modèle autour du milieu de tableau en texte et plus bas en code. La très longue extension de contexte dépasse la fenêtre native et doit donc être distinguée de celle-ci. Le modèle cible surtout les déploiements multilingues, multimodaux et sensibles au coût, avec validation préalable sur les tâches de connaissance, de raisonnement et de programmation.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Epoch AI (epoch.ai), CC-BY-4.0 · Benchable.ai (benchable.ai).