Qwen3 VL 30B A3B Thinking
Publié par Qwen le 22 septembre 2025, Qwen3 VL 30B A3B Thinking est un modèle vision-langage open-weights de 31 milliards de paramètres. Cette édition Thinking associe une architecture MoE à un raisonnement renforcé, avec une fenêtre de contexte de 262 144 tokens.
Publié par Qwen le 22 septembre 2025, Qwen3 VL 30B A3B Thinking est un modèle vision-langage open-weights de 31 milliards de paramètres. Cette édition Thinking associe une architecture MoE à un raisonnement renforcé, avec une fenêtre de contexte de 262 144 tokens.
Le modèle traite conjointement texte, images et vidéos. Ses fonctions couvrent notamment l’OCR en 32 langues, l’analyse d’interfaces PC et mobiles, la perception spatiale 2D et 3D, ainsi que la génération de Draw.io, HTML, CSS et JavaScript à partir de contenus visuels. Sa licence Apache 2.0 autorise l’usage commercial.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 31 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 95,0 % | 9ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 94,7 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Redux | 90,9 % | 23ᵉ / 48 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 88,9 % | 9ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU | 87,6 % | 20ᵉ / 98 | llm-stats | Auto-déclaré |
| AI2D | 86,9 % | 18ᵉ / 32 | llm-stats | Auto-déclaré |
| CharXiv-D | 86,9 % | 9ᵉ / 16 | llm-stats | Auto-déclaré |
| InfoVQAtest | 86,0 % | 6ᵉ / 12 | llm-stats | Auto-déclaré |
| WritingBench | 85,2 % | 7ᵉ / 15 | llm-stats | Auto-déclaré |
| OCRBench | 83,9 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| AIME 2025 | 83,1 % | 59ᵉ / 108 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 82,5 % | 10ᵉ / 12 | llm-stats | Auto-déclaré |
| MathVista-Mini | 81,9 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| IFEval | 81,7 % | 50ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU-Pro | 80,5 % | 51ᵉ / 125 | llm-stats | Auto-déclaré |
| MLVU-M | 78,9 % | 3ᵉ / 8 | llm-stats | Auto-déclaré |
| CC-OCR | 77,8 % | 13ᵉ / 18 | llm-stats | Auto-déclaré |
| MuirBench | 77,6 % | 3ᵉ / 11 | llm-stats | Auto-déclaré |
| RealWorldQA | 77,4 % | 15ᵉ / 25 | llm-stats | Auto-déclaré |
| MMLU-ProX | 76,1 % | 18ᵉ / 32 | llm-stats | Auto-déclaré |
| MMMU (val) | 76,0 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| MMStar | 75,5 % | 10ᵉ / 22 | llm-stats | Auto-déclaré |
| VideoMMMU | 75,0 % | 19ᵉ / 26 | llm-stats | Auto-déclaré |
| Include | 74,5 % | 17ᵉ / 31 | llm-stats | Auto-déclaré |
| GPQA | 74,4 % | 101ᵉ / 219 | llm-stats | Auto-déclaré |
| Video-MME | 73,3 % | 13ᵉ / 17 | llm-stats | Auto-déclaré |
| Multi-IF | 73,0 % | 12ᵉ / 20 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 72,1 % | 9ᵉ / 14 | llm-stats | Auto-déclaré |
| MVBench | 72,0 % | 10ᵉ / 17 | llm-stats | Auto-déclaré |
| BFCL-v3 | 68,6 % | 13ᵉ / 19 | llm-stats | Auto-déclaré |
| HMMT25 | 67,6 % | 17ᵉ / 25 | llm-stats | Auto-déclaré |
| Hallusion Bench | 66,0 % | 7ᵉ / 16 | llm-stats | Auto-déclaré |
| MathVision | 65,7 % | 19ᵉ / 32 | llm-stats | Auto-déclaré |
| BLINK | 65,4 % | 11ᵉ / 13 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 64,2 % | 37ᵉ / 53 | llm-stats | Auto-déclaré |
| MMMU-Pro | 63,0 % | 42ᵉ / 64 | llm-stats | Auto-déclaré |
| CharadesSTA | 62,7 % | 5ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 62,6 % | 9ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 60,4 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| LVBench | 59,2 % | 14ᵉ / 23 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 57,3 % | 16ᵉ / 23 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 56,7 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| CharXiv-R | 56,6 % | 37ᵉ / 45 | llm-stats | Auto-déclaré |
| SuperGPQA | 56,4 % | 23ᵉ / 34 | llm-stats | Auto-déclaré |
| PolyMATH | 51,7 % | 12ᵉ / 23 | llm-stats | Auto-déclaré |
| ERQA | 45,3 % | 19ᵉ / 22 | llm-stats | Auto-déclaré |
| ODinW | 42,3 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| OSWorld | 30,6 % | 16ᵉ / 20 | llm-stats | Auto-déclaré |
| SimpleQA | 23,9 % | 29ᵉ / 45 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 7,9 % | 12ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,13 $ | 1,56 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,06 $ |
| Latence moyenne par benchmark — Benchable | 53 min 58 s |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen3 VL 30B A3B Thinking se distingue particulièrement sur Ethics, où il atteint le top 10, et sur Email Classification, où il se place dans le premier dixième du classement. À sa sortie, son résultat GPQA le situait dans le top 29% des LLM de sa génération. Son architecture combine Interleaved-MRoPE, DeepStack et un alignement entre texte et horodatage, utile pour comprendre une vidéo, localiser temporellement des événements et relier perception visuelle et raisonnement. Son autre avantage majeur est économique : sa tarification se situe 93% sous la moyenne des LLM similaires et environ 42,3 fois sous celle des modèles frontière.
Limites et points d'attention. Les résultats bruts élevés en General Knowledge, Mathematics et Coding doivent être nuancés par des classements situés autour du milieu de tableau ou en dessous. Hallucinations constitue le point le plus faible de l’évaluation, avec une position dans le dernier quart du panel, ce qui appelle à contrôler les réponses factuelles. Le contexte natif est de 256K, avec une extension annoncée jusqu’à 1M. Le modèle convient surtout aux traitements multimodaux à grand contexte, à l’OCR multilingue, à l’analyse vidéo horodatée et aux projets sensibles au coût d’inférence.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).