Qwen3 VL 235B A22B Thinking

Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Thinking est un modèle vision-langage de 236 milliards de paramètres, orienté raisonnement et distribué sous licence Apache 2.0. Il traite le texte, les images et les vidéos, avec une fenêtre de contexte de 262 144 tokens.

Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Thinking est un modèle vision-langage de 236 milliards de paramètres, orienté raisonnement et distribué sous licence Apache 2.0. Il traite le texte, les images et les vidéos, avec une fenêtre de contexte de 262 144 tokens.

Le modèle se distingue par l’OCR en 32 langues, l’analyse de vidéos longues, le raisonnement spatial, l’interaction avec des interfaces PC et mobiles, ainsi que la génération de code visuel à partir d’images ou de vidéos. Ses architectures Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment ciblent l’alignement multimodal et la localisation temporelle.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres236 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
ZebraLogic97,3 %1ᵉ / 7llm-statsAuto-déclaré
DocVQAtest96,5 %3ᵉ / 11llm-statsAuto-déclaré
ScreenSpot95,4 %3ᵉ / 16llm-statsAuto-déclaré
CountBench93,7 %6ᵉ / 6llm-statsAuto-déclaré
MMLU-Redux93,7 %8ᵉ / 48llm-statsAuto-déclaré
RefCOCO-avg92,4 %3ᵉ / 7llm-statsAuto-déclaré
MMBench-V1.190,6 %7ᵉ / 18llm-statsAuto-déclaré
MMLU90,6 %5ᵉ / 98llm-statsAuto-déclaré
AIME 202589,7 %45ᵉ / 108llm-statsAuto-déclaré
InfoVQAtest89,5 %2ᵉ / 12llm-statsAuto-déclaré
AI2D89,2 %14ᵉ / 32llm-statsAuto-déclaré
IFEval88,2 %26ᵉ / 65llm-statsAuto-déclaré
OCRBench87,5 %13ᵉ / 22llm-statsAuto-déclaré
WritingBench86,7 %3ᵉ / 15llm-statsAuto-déclaré
MathVista-Mini85,8 %8ᵉ / 23llm-statsAuto-déclaré
Creative Writing v385,7 %4ᵉ / 12llm-statsAuto-déclaré
EmbSpatialBench84,3 %3ᵉ / 8llm-statsAuto-déclaré
MLVU83,8 %9ᵉ / 10llm-statsAuto-déclaré
MMLU-Pro83,8 %26ᵉ / 125llm-statsAuto-déclaré
CC-OCR81,5 %5ᵉ / 18llm-statsAuto-déclaré
RealWorldQA81,3 %10ᵉ / 25llm-statsAuto-déclaré
MMLU-ProX80,6 %10ᵉ / 32llm-statsAuto-déclaré
MMMUval80,6 %1ᵉ / 4llm-statsAuto-déclaré
MuirBench80,1 %2ᵉ / 11llm-statsAuto-déclaré
Include80,0 %9ᵉ / 31llm-statsAuto-déclaré
VideoMMMU80,0 %17ᵉ / 26llm-statsAuto-déclaré
LiveBench 2024112579,6 %1ᵉ / 14llm-statsAuto-déclaré
Multi-IF79,1 %3ᵉ / 20llm-statsAuto-déclaré
VideoMME w/o sub.79,0 %6ᵉ / 10llm-statsAuto-déclaré
MMStar78,7 %7ᵉ / 22llm-statsAuto-déclaré
HMMT2577,4 %13ᵉ / 25llm-statsAuto-déclaré
MathVision74,6 %14ᵉ / 32llm-statsAuto-déclaré
BFCL-v371,9 %6ᵉ / 19llm-statsAuto-déclaré
LiveCodeBench v670,1 %29ᵉ / 53llm-statsAuto-déclaré
RefSpatialBench69,9 %2ᵉ / 6llm-statsAuto-déclaré
MMMU-Pro69,3 %35ᵉ / 64llm-statsAuto-déclaré
BLINK67,1 %9ᵉ / 13llm-statsAuto-déclaré
OCRBench-V2 (en)66,8 %4ᵉ / 12llm-statsAuto-déclaré
Hallusion Bench66,7 %6ᵉ / 16llm-statsAuto-déclaré
CharXiv-R66,1 %30ᵉ / 45llm-statsAuto-déclaré
SuperGPQA64,3 %13ᵉ / 34llm-statsAuto-déclaré
LVBench63,6 %11ᵉ / 23llm-statsAuto-déclaré
CharadesSTA63,5 %2ᵉ / 12llm-statsAuto-déclaré
OCRBench-V2 (zh)63,5 %1ᵉ / 11llm-statsAuto-déclaré
ScreenSpot Pro61,8 %12ᵉ / 23llm-statsAuto-déclaré
SimpleVQA61,3 %9ᵉ / 13llm-statsAuto-déclaré
MMLongBench-Doc56,2 %5ᵉ / 5llm-statsAuto-déclaré
ERQA52,5 %12ᵉ / 22llm-statsAuto-déclaré
SimpleQA44,4 %18ᵉ / 45llm-statsAuto-déclaré
ODinW43,2 %10ᵉ / 16llm-statsAuto-déclaré
OSWorld38,1 %11ᵉ / 20llm-statsAuto-déclaré
SUNRGBD34,9 %3ᵉ / 4llm-statsAuto-déclaré
VisuLogic34,4 %3ᵉ / 3llm-statsAuto-déclaré
ZEROBench-Sub27,7 %5ᵉ / 5llm-statsAuto-déclaré
Humanity's Last Exam13,6 %73ᵉ / 89llm-statsAuto-déclaré
Hypersim11,0 %4ᵉ / 4llm-statsAuto-déclaré
MM-MT-Bench8,5 %5ᵉ / 17llm-statsAuto-déclaré
ZEROBench4,0 %9ᵉ / 9llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
132ᵉDeepSeek-V3 03241396
133ᵉQwen3.5-35B-A3B1396
134ᵉQwen3 VL 235B A22B Thinking1395
135ᵉhunyuan-vision-1.5-thinking1395
136ᵉStep-3.5-Flash1395

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
65ᵉClaude 3.7 Sonnet1195
66ᵉo11193
67ᵉQwen3 VL 235B A22B Thinking1189
68ᵉClaude Sonnet 41188
69ᵉClaude Opus 41188

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,26 $2,6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,53 $
Latence moyenne par benchmark — Benchable39 min 18 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Qwen3 VL 235B A22B Thinking figurait dans le top 6% des LLM de sa génération sur MMLU-Pro. Son meilleur positionnement Benchable concerne Instruction Following, où il se place dans le premier cinquième du classement. Les scores de baseline sont également élevés en classification d’e-mails et sur le test d’hallucinations, même si leurs rangs restent plus modestes. La grande fenêtre de contexte, extensible de 256K à 1M selon la configuration annoncée, soutient le traitement de longs documents et de vidéos longues. Son tarif est très économique, inférieur de 87% à la moyenne des LLM similaires et environ 21,2 fois moins élevé que celui des modèles frontière.

Limites et points d'attention. L’orientation Thinking ne se traduit pas dans les résultats Benchable de baseline en raisonnement, en mathématiques et en code, où le modèle se situe près du bas des classements. Coding affiche même un score nul. Les évaluations Arena le placent aussi dans la seconde moitié du classement en texte comme en vision, à distance des modèles en tête. Ces écarts invitent à distinguer ses fonctions multimodales déclarées de ses performances mesurées sur des tâches spécialisées. Il convient surtout aux usages multimodaux à long contexte, à l’OCR multilingue et à l’analyse d’interfaces ou de vidéos lorsque le coût constitue un critère prioritaire.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).