Qwen3 VL 235B A22B Instruct
Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Instruct est un modèle vision-langage Instruct de 236 milliards de paramètres, dont 22 milliards actifs. Sa fenêtre de contexte atteint 262 144 tokens et ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.
Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Instruct est un modèle vision-langage Instruct de 236 milliards de paramètres, dont 22 milliards actifs. Sa fenêtre de contexte atteint 262 144 tokens et ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.
Le modèle associe texte, images et vidéo pour comprendre des interfaces, produire du Draw.io ou du code web à partir de contenus visuels, analyser l’espace en 2D et 3D et localiser des événements dans une vidéo. Son OCR couvre 32 langues, y compris sur des images sombres, floues ou inclinées. Ses poids sont proposés sous licence Apache 2.0, avec usage commercial autorisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 236 milliards |
| Paramètres actifs | 22 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image → text |
Indices de synthèse
| Indice | Valeur | Rang (LLM) |
|---|---|---|
| Intelligence Index | 14.3 | 115ᵉ / 137 |
| Math Index | 70.7 | 23ᵉ / 54 |
Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 97,1 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 95,4 % | 3ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Redux | 92,2 % | 19ᵉ / 48 | llm-stats | Auto-déclaré |
| OCRBench | 92,0 % | 3ᵉ / 22 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 89,9 % | 8ᵉ / 18 | llm-stats | Auto-déclaré |
| AI2D | 89,7 % | 12ᵉ / 32 | llm-stats | Auto-déclaré |
| InfoVQAtest | 89,2 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| MMLU | 88,8 % | 15ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 87,8 % | 28ᵉ / 65 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 86,5 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| MultiPL-E | 86,1 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| WritingBench | 85,5 % | 5ᵉ / 15 | llm-stats | Auto-déclaré |
| MathVista-Mini | 84,9 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| MLVU | 84,3 % | 8ᵉ / 10 | llm-stats | Auto-déclaré |
| CSimpleQA | 83,4 % | 3ᵉ / 7 | llm-stats | Auto-déclaré |
| CC-OCR | 82,2 % | 2ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU-Pro | 81,8 % | 39ᵉ / 125 | llm-stats | Auto-déclaré |
| Include | 80,0 % | 9ᵉ / 31 | llm-stats | Auto-déclaré |
| RealWorldQA | 79,3 % | 11ᵉ / 25 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 79,2 % | 5ᵉ / 10 | llm-stats | Auto-déclaré |
| MMMUval | 78,7 % | 2ᵉ / 4 | llm-stats | Auto-déclaré |
| MMStar | 78,4 % | 8ᵉ / 22 | llm-stats | Auto-déclaré |
| MMLU-ProX | 77,8 % | 14ᵉ / 32 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 77,4 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| Multi-IF | 76,3 % | 7ᵉ / 20 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 74,8 % | 6ᵉ / 14 | llm-stats | Auto-déclaré |
| AIME 2025 | 74,7 % | 73ᵉ / 108 | llm-stats | Auto-déclaré |
| VideoMMMU | 74,7 % | 20ᵉ / 26 | llm-stats | Auto-déclaré |
| MuirBench | 72,8 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| BLINK | 70,7 % | 3ᵉ / 13 | llm-stats | Auto-déclaré |
| MMMU-Pro | 68,1 % | 37ᵉ / 64 | llm-stats | Auto-déclaré |
| BFCL-v3 | 67,7 % | 14ᵉ / 19 | llm-stats | Auto-déclaré |
| LVBench | 67,7 % | 9ᵉ / 23 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 67,1 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| OSWorld | 66,7 % | 5ᵉ / 20 | llm-stats | Auto-déclaré |
| MathVision | 66,5 % | 18ᵉ / 32 | llm-stats | Auto-déclaré |
| CharadesSTA | 64,8 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 63,7 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| Hallusion Bench | 63,2 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| CharXiv-R | 62,1 % | 33ᵉ / 45 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 62,0 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 61,8 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench v5 | 61,4 % | 3ᵉ / 9 | llm-stats | Auto-déclaré |
| SuperGPQA | 60,4 % | 17ᵉ / 34 | llm-stats | Auto-déclaré |
| HMMT25 | 57,4 % | 19ᵉ / 25 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 54,3 % | 41ᵉ / 53 | llm-stats | Auto-déclaré |
| SimpleQA | 51,9 % | 13ᵉ / 45 | llm-stats | Auto-déclaré |
| ERQA | 51,3 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| ODinW | 48,6 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 8,5 % | 5ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
Intelligence Index
Math Index
Classements Arena (Elo)
Arena Text · 200 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1507 |
| 2ᵉ | Claude Opus 4.6 | 1504 |
| 3ᵉ | Claude Opus 4.7 | 1503 |
| ⋯ | ⋯ | |
| 106ᵉ | MiniMax M2.7 | 1417 |
| 107ᵉ | Mistral Large 3 | 1416 |
| 108ᵉ | Qwen3 VL 235B A22B Instruct | 1415 |
| 109ᵉ | DeepSeek V3.1 Terminus | 1415 |
| 110ᵉ | amazon-nova-experimental-chat-26-01-10 | 1415 |
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 51ᵉ | ernie-5.0-preview-1220 | 1218 |
| 52ᵉ | o3 | 1216 |
| 53ᵉ | Qwen3 VL 235B A22B Instruct | 1215 |
| 54ᵉ | Gemini 2.5 Flash | 1214 |
| 55ᵉ | GPT-4.1 | 1214 |
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| DeepInfra | 0,2 $ | 0,88 $ | 0,11 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,02 $ |
| Latence moyenne par benchmark — Benchable | 5 min 24 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. À sa sortie, Qwen3 VL 235B A22B Instruct appartenait au top 18% des LLM de sa génération sur MMLU-Pro. Ses résultats Benchable atteignent le premier rang sur les évaluations Hallucinations, General Knowledge, Reasoning et Ethics, tandis que son Math Index le place dans le haut du classement. Ses architectures Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment soutiennent l’alignement image-texte, le raisonnement vidéo et la localisation temporelle. Le contexte long et les fonctions de perception visuelle élargissent son champ d’usage aux interfaces PC et mobiles, aux documents multilingues et à la génération de contenus web. Son tarif est très économique, inférieur de 90% à la moyenne des LLM similaires et environ 27,5 fois moins élevé que celui des modèles frontière.
Limites et points d’attention. L’Intelligence Index situe le modèle dans le bas du classement global. Les résultats Arena restent en seconde moitié de tableau en texte comme en vision, avec un écart notable face au modèle en tête. Email Classification se classe également bas malgré un score brut élevé, et Mathematics n’atteint que le milieu du classement Benchable. Le modèle convient surtout aux usages multimodaux à grand contexte, à l’OCR multilingue, à l’analyse vidéo et aux déploiements recherchant des poids ouverts avec un coût d’inférence réduit.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).