Qwen3 VL 30B A3B Instruct

Qwen3 VL 30B A3B Instruct est un modèle vision-langage de Qwen, publié le 22 septembre 2025 sous licence Apache 2.0. Son architecture MoE traite des conversations associant texte et image, avec des fonctions orientées vers les agents visuels, la génération de code visuel et la perception…

Qwen3 VL 30B A3B Instruct est un modèle vision-langage de Qwen, publié le 22 septembre 2025 sous licence Apache 2.0. Son architecture MoE traite des conversations associant texte et image, avec des fonctions orientées vers les agents visuels, la génération de code visuel et la perception spatiale.

Ses 31 milliards de paramètres s’accompagnent d’une fenêtre de contexte de 262 144 tokens. Le modèle couvre aussi la compréhension de vidéos longues, la localisation temporelle, l’OCR en 32 langues et le raisonnement multimodal en STEM et en mathématiques, avec un positionnement tarifaire très économique.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres31 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image,video → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest95,0 %9ᵉ / 11llm-statsAuto-déclaré
ScreenSpot94,7 %5ᵉ / 16llm-statsAuto-déclaré
OCRBench90,3 %5ᵉ / 22llm-statsAuto-déclaré
MMLU-Redux88,4 %30ᵉ / 48llm-statsAuto-déclaré
MMBench-V1.187,0 %11ᵉ / 18llm-statsAuto-déclaré
IFEval85,8 %37ᵉ / 65llm-statsAuto-déclaré
CharXiv-D85,5 %11ᵉ / 16llm-statsAuto-déclaré
AI2D85,0 %20ᵉ / 32llm-statsAuto-déclaré
MMLU85,0 %42ᵉ / 98llm-statsAuto-déclaré
Creative Writing v384,6 %8ᵉ / 12llm-statsAuto-déclaré
WritingBench82,6 %13ᵉ / 15llm-statsAuto-déclaré
InfoVQAtest82,0 %11ᵉ / 12llm-statsAuto-déclaré
MLVU-M81,3 %2ᵉ / 8llm-statsAuto-déclaré
CC-OCR80,7 %8ᵉ / 18llm-statsAuto-déclaré
MathVista-Mini80,1 %13ᵉ / 23llm-statsAuto-déclaré
MMLU-Pro77,8 %59ᵉ / 125llm-statsAuto-déclaré
Video-MME74,5 %12ᵉ / 17llm-statsAuto-déclaré
MMMU (val)74,2 %4ᵉ / 11llm-statsAuto-déclaré
RealWorldQA73,7 %16ᵉ / 25llm-statsAuto-déclaré
MVBench72,3 %9ᵉ / 17llm-statsAuto-déclaré
MMStar72,1 %13ᵉ / 22llm-statsAuto-déclaré
Include71,6 %20ᵉ / 31llm-statsAuto-déclaré
MMLU-ProX70,9 %21ᵉ / 32llm-statsAuto-déclaré
GPQA70,4 %116ᵉ / 219llm-statsAuto-déclaré
AIME 202569,3 %85ᵉ / 108llm-statsAuto-déclaré
VideoMMMU68,7 %23ᵉ / 26llm-statsAuto-déclaré
BLINK67,7 %7ᵉ / 13llm-statsAuto-déclaré
BFCL-v366,3 %16ᵉ / 19llm-statsAuto-déclaré
Multi-IF66,1 %18ᵉ / 20llm-statsAuto-déclaré
LiveBench 2024112565,4 %12ᵉ / 14llm-statsAuto-déclaré
CharadesSTA63,5 %2ᵉ / 12llm-statsAuto-déclaré
OCRBench-V2 (en)63,2 %8ᵉ / 12llm-statsAuto-déclaré
MuirBench62,9 %10ᵉ / 11llm-statsAuto-déclaré
LVBench62,5 %13ᵉ / 23llm-statsAuto-déclaré
Hallusion Bench61,5 %12ᵉ / 16llm-statsAuto-déclaré
ScreenSpot Pro60,5 %13ᵉ / 23llm-statsAuto-déclaré
MMMU-Pro60,4 %46ᵉ / 64llm-statsAuto-déclaré
MathVision60,2 %22ᵉ / 32llm-statsAuto-déclaré
Arena-Hard v258,5 %12ᵉ / 16llm-statsAuto-déclaré
OCRBench-V2 (zh)57,8 %9ᵉ / 11llm-statsAuto-déclaré
SuperGPQA53,1 %25ᵉ / 34llm-statsAuto-déclaré
HMMT2550,6 %23ᵉ / 25llm-statsAuto-déclaré
CharXiv-R48,9 %42ᵉ / 45llm-statsAuto-déclaré
ODinW47,5 %6ᵉ / 16llm-statsAuto-déclaré
PolyMATH44,3 %18ᵉ / 23llm-statsAuto-déclaré
ERQA43,0 %20ᵉ / 22llm-statsAuto-déclaré
LiveCodeBench v642,6 %49ᵉ / 53llm-statsAuto-déclaré
OSWorld30,3 %17ᵉ / 20llm-statsAuto-déclaré
SimpleQA27,0 %26ᵉ / 45llm-statsAuto-déclaré
MM-MT-Bench8,1 %9ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,13 $0,52 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 42,3 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. À sa sortie, Qwen3 VL 30B A3B Instruct se situait dans le top 38% des 130 LLM de sa génération sur GPQA, un résultat qui le plaçait dans la partie supérieure du classement sans en faire un modèle de tête. Son principal atout réside dans l’étendue de ses usages multimodaux. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment structurent respectivement le traitement multimodal, l’alignement image-texte et la localisation temporelle dans les vidéos. La fenêtre de 262 144 tokens favorise le traitement de contenus longs. La licence Apache 2.0 autorise l’usage commercial et l’accès open-weights. Les tarifs sont inférieurs de 93% à la moyenne des LLM similaires et environ 42,3 fois plus bas que ceux des modèles frontière.

Limites et points d’attention. Le classement GPQA reste en retrait des meilleurs modèles de sa génération, ce qui tempère son positionnement sur les tâches évaluées par ce benchmark. Ses connaissances s’arrêtent au 31 mars 2025, un point important pour les usages dépendant d’informations plus récentes. Qwen3 VL 30B A3B Instruct vise ainsi surtout les projets multimodaux recherchant un long contexte, des fonctions image et vidéo, une licence commerciale ouverte et un coût d’inférence contenu.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).