Qwen3 VL 4B Instruct

Qwen3 VL 4B Instruct est un modèle vision-langage de Qwen, sorti le 22 septembre 2025. Ses 4 milliards de paramètres, sa licence Apache 2.0 autorisant l’usage commercial et son positionnement très économique en font un modèle multimodal orienté vers un déploiement accessible.

Qwen3 VL 4B Instruct est un modèle vision-langage de Qwen, sorti le 22 septembre 2025. Ses 4 milliards de paramètres, sa licence Apache 2.0 autorisant l’usage commercial et son positionnement très économique en font un modèle multimodal orienté vers un déploiement accessible.

Le modèle traite le texte, les images, les longues vidéos et les documents. Il prend aussi en charge l’OCR dans 32 langues, l’interaction avec des interfaces PC et mobiles, ainsi que la génération de Draw.io, HTML, CSS et JavaScript à partir d’images ou de vidéos. Il est utilisable avec Hugging Face Transformers et ModelScope.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres4 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest95,3 %7ᵉ / 11llm-statsAuto-déclaré
ScreenSpot94,0 %8ᵉ / 16llm-statsAuto-déclaré
OCRBench88,1 %11ᵉ / 22llm-statsAuto-déclaré
MMBench-V1.185,1 %13ᵉ / 18llm-statsAuto-déclaré
AI2D84,1 %25ᵉ / 32llm-statsAuto-déclaré
WritingBench82,5 %14ᵉ / 15llm-statsAuto-déclaré
IFEval82,3 %49ᵉ / 65llm-statsAuto-déclaré
MMLU-Redux81,5 %38ᵉ / 48llm-statsAuto-déclaré
InfoVQAtest80,3 %12ᵉ / 12llm-statsAuto-déclaré
MMLU77,2 %70ᵉ / 98llm-statsAuto-déclaré
CC-OCR76,2 %17ᵉ / 18llm-statsAuto-déclaré
CharXiv-D76,2 %15ᵉ / 16llm-statsAuto-déclaré
MLVU-M75,3 %6ᵉ / 8llm-statsAuto-déclaré
MathVista-Mini73,7 %18ᵉ / 23llm-statsAuto-déclaré
RealWorldQA70,9 %20ᵉ / 25llm-statsAuto-déclaré
MMStar69,8 %16ᵉ / 22llm-statsAuto-déclaré
MVBench68,9 %16ᵉ / 17llm-statsAuto-déclaré
MMMU (val)67,4 %8ᵉ / 11llm-statsAuto-déclaré
MMLU-Pro67,1 %90ᵉ / 125llm-statsAuto-déclaré
BLINK65,8 %10ᵉ / 13llm-statsAuto-déclaré
MuirBench63,8 %9ᵉ / 11llm-statsAuto-déclaré
OCRBench-V2 (en)63,7 %7ᵉ / 12llm-statsAuto-déclaré
BFCL-v363,3 %18ᵉ / 19llm-statsAuto-déclaré
Include61,4 %25ᵉ / 31llm-statsAuto-déclaré
LiveBench 2024112560,9 %14ᵉ / 14llm-statsAuto-déclaré
ScreenSpot Pro59,5 %14ᵉ / 23llm-statsAuto-déclaré
MMLU-ProX59,4 %26ᵉ / 32llm-statsAuto-déclaré
Hallusion Bench57,6 %14ᵉ / 16llm-statsAuto-déclaré
OCRBench-V2 (zh)57,6 %10ᵉ / 11llm-statsAuto-déclaré
LVBench56,2 %16ᵉ / 23llm-statsAuto-déclaré
VideoMMMU56,2 %26ᵉ / 26llm-statsAuto-déclaré
CharadesSTA55,5 %10ᵉ / 12llm-statsAuto-déclaré
MMMU-Pro53,2 %54ᵉ / 64llm-statsAuto-déclaré
MathVision51,6 %27ᵉ / 32llm-statsAuto-déclaré
ODinW48,2 %5ᵉ / 16llm-statsAuto-déclaré
SimpleQA48,0 %16ᵉ / 45llm-statsAuto-déclaré
AIME 202546,6 %99ᵉ / 108llm-statsAuto-déclaré
ERQA41,3 %21ᵉ / 22llm-statsAuto-déclaré
SuperGPQA40,3 %32ᵉ / 34llm-statsAuto-déclaré
CharXiv-R39,7 %45ᵉ / 45llm-statsAuto-déclaré
LiveCodeBench v637,9 %52ᵉ / 53llm-statsAuto-déclaré
HMMT2530,7 %25ᵉ / 25llm-statsAuto-déclaré
PolyMATH28,8 %21ᵉ / 23llm-statsAuto-déclaré
OSWorld26,2 %18ᵉ / 20llm-statsAuto-déclaré
MM-MT-Bench7,5 %16ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
deepinfra0,1 $0,6 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. Qwen3 VL 4B Instruct associe un format relativement compact à une fenêtre de contexte de 262 144 tokens, avec une extension possible jusqu’à 1M. Interleaved-MRoPE, DeepStack et l’alignement entre texte et horodatage soutiennent le raisonnement sur la vidéo et l’association entre images et texte. Sa perception spatiale, son OCR multilingue et sa capacité à interpréter des interfaces élargissent ses usages à l’analyse documentaire, aux longues vidéos et à l’automatisation visuelle. Son principal avantage reste économique : ses tarifs se situent 95% sous la moyenne des LLM similaires et environ 55 fois sous ceux des modèles frontière. La licence Apache 2.0 autorise en outre les usages commerciaux.

Limites et points d’attention. À sa sortie, le modèle se situait dans les 64% les mieux classés parmi les LLM de sa génération sur MMLU-Pro. Ce résultat le place loin du groupe de tête en connaissances générales et en raisonnement, malgré ses fonctions multimodales étendues. L’évaluation disponible repose sur une seule source de données concordante, ce qui limite la portée des comparaisons. Qwen3 VL 4B Instruct convient surtout aux usages multimodaux sensibles au coût, notamment l’OCR, l’analyse de documents ou de vidéos et l’interaction avec des interfaces.


Sources des données : LLM-Stats (llm-stats.com).