Qwen3 VL 30B A3B Instruct
Qwen3 VL 30B A3B Instruct est un modèle vision-langage de Qwen, publié le 22 septembre 2025 sous licence Apache 2.0. Son architecture MoE traite des conversations associant texte et image, avec des fonctions orientées vers les agents visuels, la génération de code visuel et la perception…
Qwen3 VL 30B A3B Instruct est un modèle vision-langage de Qwen, publié le 22 septembre 2025 sous licence Apache 2.0. Son architecture MoE traite des conversations associant texte et image, avec des fonctions orientées vers les agents visuels, la génération de code visuel et la perception spatiale.
Ses 31 milliards de paramètres s’accompagnent d’une fenêtre de contexte de 262 144 tokens. Le modèle couvre aussi la compréhension de vidéos longues, la localisation temporelle, l’OCR en 32 langues et le raisonnement multimodal en STEM et en mathématiques, avec un positionnement tarifaire très économique.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 31 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 95,0 % | 9ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 94,7 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| OCRBench | 90,3 % | 5ᵉ / 22 | llm-stats | Auto-déclaré |
| MMLU-Redux | 88,4 % | 30ᵉ / 48 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 87,0 % | 11ᵉ / 18 | llm-stats | Auto-déclaré |
| IFEval | 85,8 % | 37ᵉ / 65 | llm-stats | Auto-déclaré |
| CharXiv-D | 85,5 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| AI2D | 85,0 % | 20ᵉ / 32 | llm-stats | Auto-déclaré |
| MMLU | 85,0 % | 42ᵉ / 98 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 84,6 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| WritingBench | 82,6 % | 13ᵉ / 15 | llm-stats | Auto-déclaré |
| InfoVQAtest | 82,0 % | 11ᵉ / 12 | llm-stats | Auto-déclaré |
| MLVU-M | 81,3 % | 2ᵉ / 8 | llm-stats | Auto-déclaré |
| CC-OCR | 80,7 % | 8ᵉ / 18 | llm-stats | Auto-déclaré |
| MathVista-Mini | 80,1 % | 13ᵉ / 23 | llm-stats | Auto-déclaré |
| MMLU-Pro | 77,8 % | 59ᵉ / 125 | llm-stats | Auto-déclaré |
| Video-MME | 74,5 % | 12ᵉ / 17 | llm-stats | Auto-déclaré |
| MMMU (val) | 74,2 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| RealWorldQA | 73,7 % | 16ᵉ / 25 | llm-stats | Auto-déclaré |
| MVBench | 72,3 % | 9ᵉ / 17 | llm-stats | Auto-déclaré |
| MMStar | 72,1 % | 13ᵉ / 22 | llm-stats | Auto-déclaré |
| Include | 71,6 % | 20ᵉ / 31 | llm-stats | Auto-déclaré |
| MMLU-ProX | 70,9 % | 21ᵉ / 32 | llm-stats | Auto-déclaré |
| GPQA | 70,4 % | 116ᵉ / 219 | llm-stats | Auto-déclaré |
| AIME 2025 | 69,3 % | 85ᵉ / 108 | llm-stats | Auto-déclaré |
| VideoMMMU | 68,7 % | 23ᵉ / 26 | llm-stats | Auto-déclaré |
| BLINK | 67,7 % | 7ᵉ / 13 | llm-stats | Auto-déclaré |
| BFCL-v3 | 66,3 % | 16ᵉ / 19 | llm-stats | Auto-déclaré |
| Multi-IF | 66,1 % | 18ᵉ / 20 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 65,4 % | 12ᵉ / 14 | llm-stats | Auto-déclaré |
| CharadesSTA | 63,5 % | 2ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 63,2 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| MuirBench | 62,9 % | 10ᵉ / 11 | llm-stats | Auto-déclaré |
| LVBench | 62,5 % | 13ᵉ / 23 | llm-stats | Auto-déclaré |
| Hallusion Bench | 61,5 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 60,5 % | 13ᵉ / 23 | llm-stats | Auto-déclaré |
| MMMU-Pro | 60,4 % | 46ᵉ / 64 | llm-stats | Auto-déclaré |
| MathVision | 60,2 % | 22ᵉ / 32 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 58,5 % | 12ᵉ / 16 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 57,8 % | 9ᵉ / 11 | llm-stats | Auto-déclaré |
| SuperGPQA | 53,1 % | 25ᵉ / 34 | llm-stats | Auto-déclaré |
| HMMT25 | 50,6 % | 23ᵉ / 25 | llm-stats | Auto-déclaré |
| CharXiv-R | 48,9 % | 42ᵉ / 45 | llm-stats | Auto-déclaré |
| ODinW | 47,5 % | 6ᵉ / 16 | llm-stats | Auto-déclaré |
| PolyMATH | 44,3 % | 18ᵉ / 23 | llm-stats | Auto-déclaré |
| ERQA | 43,0 % | 20ᵉ / 22 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 42,6 % | 49ᵉ / 53 | llm-stats | Auto-déclaré |
| OSWorld | 30,3 % | 17ᵉ / 20 | llm-stats | Auto-déclaré |
| SimpleQA | 27,0 % | 26ᵉ / 45 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 8,1 % | 9ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,13 $ | 0,52 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. À sa sortie, Qwen3 VL 30B A3B Instruct se situait dans le top 38% des 130 LLM de sa génération sur GPQA, un résultat qui le plaçait dans la partie supérieure du classement sans en faire un modèle de tête. Son principal atout réside dans l’étendue de ses usages multimodaux. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment structurent respectivement le traitement multimodal, l’alignement image-texte et la localisation temporelle dans les vidéos. La fenêtre de 262 144 tokens favorise le traitement de contenus longs. La licence Apache 2.0 autorise l’usage commercial et l’accès open-weights. Les tarifs sont inférieurs de 93% à la moyenne des LLM similaires et environ 42,3 fois plus bas que ceux des modèles frontière.
Limites et points d’attention. Le classement GPQA reste en retrait des meilleurs modèles de sa génération, ce qui tempère son positionnement sur les tâches évaluées par ce benchmark. Ses connaissances s’arrêtent au 31 mars 2025, un point important pour les usages dépendant d’informations plus récentes. Qwen3 VL 30B A3B Instruct vise ainsi surtout les projets multimodaux recherchant un long contexte, des fonctions image et vidéo, une licence commerciale ouverte et un coût d’inférence contenu.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).