Qwen3 VL 235B A22B Instruct

Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Instruct est un modèle vision-langage Instruct de 236 milliards de paramètres, dont 22 milliards actifs. Sa fenêtre de contexte atteint 262 144 tokens et ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.

Publié par Qwen le 22 septembre 2025, Qwen3 VL 235B A22B Instruct est un modèle vision-langage Instruct de 236 milliards de paramètres, dont 22 milliards actifs. Sa fenêtre de contexte atteint 262 144 tokens et ses connaissances couvrent les informations disponibles jusqu’au 31 mars 2025.

Le modèle associe texte, images et vidéo pour comprendre des interfaces, produire du Draw.io ou du code web à partir de contenus visuels, analyser l’espace en 2D et 3D et localiser des événements dans une vidéo. Son OCR couvre 32 langues, y compris sur des images sombres, floues ou inclinées. Ses poids sont proposés sous licence Apache 2.0, avec usage commercial autorisé.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres236 milliards
Paramètres actifs22 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image → text

Indices de synthèse

IndiceValeurRang (LLM)
Intelligence Index14.3115ᵉ / 137
Math Index70.723ᵉ / 54

Indices Artificial Analysis. Le rang situe le modèle parmi tous les LLM du catalogue disposant de l'indice.

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest97,1 %1ᵉ / 11llm-statsAuto-déclaré
ScreenSpot95,4 %3ᵉ / 16llm-statsAuto-déclaré
MMLU-Redux92,2 %19ᵉ / 48llm-statsAuto-déclaré
OCRBench92,0 %3ᵉ / 22llm-statsAuto-déclaré
MMBench-V1.189,9 %8ᵉ / 18llm-statsAuto-déclaré
AI2D89,7 %12ᵉ / 32llm-statsAuto-déclaré
InfoVQAtest89,2 %3ᵉ / 12llm-statsAuto-déclaré
MMLU88,8 %15ᵉ / 98llm-statsAuto-déclaré
IFEval87,8 %28ᵉ / 65llm-statsAuto-déclaré
Creative Writing v386,5 %2ᵉ / 12llm-statsAuto-déclaré
MultiPL-E86,1 %3ᵉ / 13llm-statsAuto-déclaré
WritingBench85,5 %5ᵉ / 15llm-statsAuto-déclaré
MathVista-Mini84,9 %9ᵉ / 23llm-statsAuto-déclaré
MLVU84,3 %8ᵉ / 10llm-statsAuto-déclaré
CSimpleQA83,4 %3ᵉ / 7llm-statsAuto-déclaré
CC-OCR82,2 %2ᵉ / 18llm-statsAuto-déclaré
MMLU-Pro81,8 %39ᵉ / 125llm-statsAuto-déclaré
Include80,0 %9ᵉ / 31llm-statsAuto-déclaré
RealWorldQA79,3 %11ᵉ / 25llm-statsAuto-déclaré
VideoMME w/o sub.79,2 %5ᵉ / 10llm-statsAuto-déclaré
MMMUval78,7 %2ᵉ / 4llm-statsAuto-déclaré
MMStar78,4 %8ᵉ / 22llm-statsAuto-déclaré
MMLU-ProX77,8 %14ᵉ / 32llm-statsAuto-déclaré
Arena-Hard v277,4 %5ᵉ / 16llm-statsAuto-déclaré
Multi-IF76,3 %7ᵉ / 20llm-statsAuto-déclaré
LiveBench 2024112574,8 %6ᵉ / 14llm-statsAuto-déclaré
AIME 202574,7 %73ᵉ / 108llm-statsAuto-déclaré
VideoMMMU74,7 %20ᵉ / 26llm-statsAuto-déclaré
MuirBench72,8 %6ᵉ / 11llm-statsAuto-déclaré
BLINK70,7 %3ᵉ / 13llm-statsAuto-déclaré
MMMU-Pro68,1 %37ᵉ / 64llm-statsAuto-déclaré
BFCL-v367,7 %14ᵉ / 19llm-statsAuto-déclaré
LVBench67,7 %9ᵉ / 23llm-statsAuto-déclaré
OCRBench-V2 (en)67,1 %3ᵉ / 12llm-statsAuto-déclaré
OSWorld66,7 %5ᵉ / 20llm-statsAuto-déclaré
MathVision66,5 %18ᵉ / 32llm-statsAuto-déclaré
CharadesSTA64,8 %1ᵉ / 12llm-statsAuto-déclaré
AndroidWorld_SR63,7 %4ᵉ / 8llm-statsAuto-déclaré
Hallusion Bench63,2 %11ᵉ / 16llm-statsAuto-déclaré
CharXiv-R62,1 %33ᵉ / 45llm-statsAuto-déclaré
ScreenSpot Pro62,0 %11ᵉ / 23llm-statsAuto-déclaré
OCRBench-V2 (zh)61,8 %3ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench v561,4 %3ᵉ / 9llm-statsAuto-déclaré
SuperGPQA60,4 %17ᵉ / 34llm-statsAuto-déclaré
HMMT2557,4 %19ᵉ / 25llm-statsAuto-déclaré
LiveCodeBench v654,3 %41ᵉ / 53llm-statsAuto-déclaré
SimpleQA51,9 %13ᵉ / 45llm-statsAuto-déclaré
ERQA51,3 %14ᵉ / 22llm-statsAuto-déclaré
ODinW48,6 %4ᵉ / 16llm-statsAuto-déclaré
MM-MT-Bench8,5 %5ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Intelligence Index

Nova 2.0 Pro Preview21.8
▶ Qwen3 VL 235B A22B Inst…14.3

Math Index

DeepSeek V3.292.0
Nova 2.0 Pro Preview89.0
▶ Qwen3 VL 235B A22B Inst…70.7

Classements Arena (Elo)

Arena Text · 200 modèles classés

RangModèleElo
1ᵉClaude Fable 51507
2ᵉClaude Opus 4.61504
3ᵉClaude Opus 4.71503
106ᵉMiniMax M2.71417
107ᵉMistral Large 31416
108ᵉQwen3 VL 235B A22B Instruct1415
109ᵉDeepSeek V3.1 Terminus1415
110ᵉamazon-nova-experimental-chat-26-01-101415

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
51ᵉernie-5.0-preview-12201218
52ᵉo31216
53ᵉQwen3 VL 235B A22B Instruct1215
54ᵉGemini 2.5 Flash1214
55ᵉGPT-4.11214

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
DeepInfra0,2 $0,88 $0,11 $

Prix en dollars US par million de tokens.

Sa tarification se situe 90 % en dessous de la moyenne des LLM similaires, et 27,5 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,02 $
Latence moyenne par benchmark — Benchable5 min 24 s

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. À sa sortie, Qwen3 VL 235B A22B Instruct appartenait au top 18% des LLM de sa génération sur MMLU-Pro. Ses résultats Benchable atteignent le premier rang sur les évaluations Hallucinations, General Knowledge, Reasoning et Ethics, tandis que son Math Index le place dans le haut du classement. Ses architectures Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment soutiennent l’alignement image-texte, le raisonnement vidéo et la localisation temporelle. Le contexte long et les fonctions de perception visuelle élargissent son champ d’usage aux interfaces PC et mobiles, aux documents multilingues et à la génération de contenus web. Son tarif est très économique, inférieur de 90% à la moyenne des LLM similaires et environ 27,5 fois moins élevé que celui des modèles frontière.

Limites et points d’attention. L’Intelligence Index situe le modèle dans le bas du classement global. Les résultats Arena restent en seconde moitié de tableau en texte comme en vision, avec un écart notable face au modèle en tête. Email Classification se classe également bas malgré un score brut élevé, et Mathematics n’atteint que le milieu du classement Benchable. Le modèle convient surtout aux usages multimodaux à grand contexte, à l’OCR multilingue, à l’analyse vidéo et aux déploiements recherchant des poids ouverts avec un coût d’inférence réduit.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Artificial Analysis (artificialanalysis.ai) · Arena.ai (arena.ai) · Benchable.ai (benchable.ai).