Qwen3 VL 235B A22B Thinking
Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Thinking est un modèle vision-langage de 236 milliards de paramètres, orienté raisonnement et distribué sous licence Apache 2.0. Il traite le texte, les images et les vidéos, avec une fenêtre de contexte de 262 144 tokens.
Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Thinking est un modèle vision-langage de 236 milliards de paramètres, orienté raisonnement et distribué sous licence Apache 2.0. Il traite le texte, les images et les vidéos, avec une fenêtre de contexte de 262 144 tokens.
Le modèle se distingue par l’OCR en 32 langues, l’analyse de vidéos longues, le raisonnement spatial, l’interaction avec des interfaces PC et mobiles, ainsi que la génération de code visuel à partir d’images ou de vidéos. Ses architectures Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment ciblent l’alignement multimodal et la localisation temporelle.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 236 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| ZebraLogic | 97,3 % | 1ᵉ / 7 | llm-stats | Auto-déclaré |
| DocVQAtest | 96,5 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 95,4 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| CountBench | 93,7 % | 6ᵉ / 6 | llm-stats | Auto-déclaré |
| MMLU-Redux | 93,7 % | 8ᵉ / 48 | llm-stats | Auto-déclaré |
| RefCOCO-avg | 92,4 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 90,6 % | 7ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU | 90,6 % | 5ᵉ / 98 | llm-stats | Auto-déclaré |
| AIME 2025 | 89,7 % | 45ᵉ / 108 | llm-stats | Auto-déclaré |
| InfoVQAtest | 89,5 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| AI2D | 89,2 % | 14ᵉ / 32 | llm-stats | Auto-déclaré |
| IFEval | 88,2 % | 26ᵉ / 65 | llm-stats | Auto-déclaré |
| OCRBench | 87,5 % | 13ᵉ / 22 | llm-stats | Auto-déclaré |
| WritingBench | 86,7 % | 3ᵉ / 15 | llm-stats | Auto-déclaré |
| MathVista-Mini | 85,8 % | 8ᵉ / 23 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 85,7 % | 4ᵉ / 12 | llm-stats | Auto-déclaré |
| EmbSpatialBench | 84,3 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| MLVU | 83,8 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| MMLU-Pro | 83,8 % | 26ᵉ / 125 | llm-stats | Auto-déclaré |
| CC-OCR | 81,5 % | 5ᵉ / 18 | llm-stats | Auto-déclaré |
| RealWorldQA | 81,3 % | 10ᵉ / 25 | llm-stats | Auto-déclaré |
| MMLU-ProX | 80,6 % | 10ᵉ / 32 | llm-stats | Auto-déclaré |
| MMMUval | 80,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| MuirBench | 80,1 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| Include | 80,0 % | 9ᵉ / 31 | llm-stats | Auto-déclaré |
| VideoMMMU | 80,0 % | 17ᵉ / 26 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 79,6 % | 1ᵉ / 14 | llm-stats | Auto-déclaré |
| Multi-IF | 79,1 % | 3ᵉ / 20 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 79,0 % | 6ᵉ / 10 | llm-stats | Auto-déclaré |
| MMStar | 78,7 % | 7ᵉ / 22 | llm-stats | Auto-déclaré |
| HMMT25 | 77,4 % | 13ᵉ / 25 | llm-stats | Auto-déclaré |
| MathVision | 74,6 % | 14ᵉ / 32 | llm-stats | Auto-déclaré |
| BFCL-v3 | 71,9 % | 6ᵉ / 19 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 70,1 % | 29ᵉ / 53 | llm-stats | Auto-déclaré |
| RefSpatialBench | 69,9 % | 2ᵉ / 6 | llm-stats | Auto-déclaré |
| MMMU-Pro | 69,3 % | 35ᵉ / 64 | llm-stats | Auto-déclaré |
| BLINK | 67,1 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 66,8 % | 4ᵉ / 12 | llm-stats | Auto-déclaré |
| Hallusion Bench | 66,7 % | 6ᵉ / 16 | llm-stats | Auto-déclaré |
| CharXiv-R | 66,1 % | 30ᵉ / 45 | llm-stats | Auto-déclaré |
| SuperGPQA | 64,3 % | 13ᵉ / 34 | llm-stats | Auto-déclaré |
| LVBench | 63,6 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| CharadesSTA | 63,5 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 63,5 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 61,8 % | 12ᵉ / 23 | llm-stats | Auto-déclaré |
| SimpleVQA | 61,3 % | 9ᵉ / 13 | llm-stats | Auto-déclaré |
| MMLongBench-Doc | 56,2 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| ERQA | 52,5 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| SimpleQA | 44,4 % | 18ᵉ / 45 | llm-stats | Auto-déclaré |
| ODinW | 43,2 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
| OSWorld | 38,1 % | 11ᵉ / 20 | llm-stats | Auto-déclaré |
| SUNRGBD | 34,9 % | 3ᵉ / 4 | llm-stats | Auto-déclaré |
| VisuLogic | 34,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| ZEROBench-Sub | 27,7 % | 5ᵉ / 5 | llm-stats | Auto-déclaré |
| Humanity's Last Exam | 13,6 % | 73ᵉ / 89 | llm-stats | Auto-déclaré |
| Hypersim | 11,0 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 8,5 % | 5ᵉ / 17 | llm-stats | Auto-déclaré |
| ZEROBench | 4,0 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 132ᵉ | DeepSeek-V3 0324 | 1396 |
| 133ᵉ | Qwen3.5-35B-A3B | 1396 |
| 134ᵉ | Qwen3 VL 235B A22B Thinking | 1395 |
| 135ᵉ | hunyuan-vision-1.5-thinking | 1395 |
| 136ᵉ | Step-3.5-Flash | 1395 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 65ᵉ | Claude 3.7 Sonnet | 1195 |
| 66ᵉ | o1 | 1193 |
| 67ᵉ | Qwen3 VL 235B A22B Thinking | 1189 |
| 68ᵉ | Claude Sonnet 4 | 1188 |
| 69ᵉ | Claude Opus 4 | 1188 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,26 $ | 2,6 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 88 % en dessous de la moyenne des LLM similaires, et 21,2 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,53 $ |
| Latence moyenne par benchmark — Benchable | 39 min 18 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Qwen3 VL 235B A22B Thinking figurait dans le top 6% des LLM de sa génération sur MMLU-Pro. Son meilleur positionnement Benchable concerne Instruction Following, où il se place dans le premier cinquième du classement. Les scores de baseline sont également élevés en classification d’e-mails et sur le test d’hallucinations, même si leurs rangs restent plus modestes. La grande fenêtre de contexte, extensible de 256K à 1M selon la configuration annoncée, soutient le traitement de longs documents et de vidéos longues. Son tarif est très économique, inférieur de 87% à la moyenne des LLM similaires et environ 21,2 fois moins élevé que celui des modèles frontière.
Limites et points d'attention. L’orientation Thinking ne se traduit pas dans les résultats Benchable de baseline en raisonnement, en mathématiques et en code, où le modèle se situe près du bas des classements. Coding affiche même un score nul. Les évaluations Arena le placent aussi dans la seconde moitié du classement en texte comme en vision, à distance des modèles en tête. Ces écarts invitent à distinguer ses fonctions multimodales déclarées de ses performances mesurées sur des tâches spécialisées. Il convient surtout aux usages multimodaux à long contexte, à l’OCR multilingue et à l’analyse d’interfaces ou de vidéos lorsque le coût constitue un critère prioritaire.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).