Qwen3 VL 4B Thinking

Publié par Qwen le 22 septembre 2025, Qwen3 VL 4B Thinking est un modèle vision-langage de 4 milliards de paramètres, conçu pour raisonner sur du texte, des images et des vidéos. Son édition Thinking met l’accent sur le raisonnement multimodal, la compréhension vidéo à long contexte, la…

Publié par Qwen le 22 septembre 2025, Qwen3 VL 4B Thinking est un modèle vision-langage de 4 milliards de paramètres, conçu pour raisonner sur du texte, des images et des vidéos. Son édition Thinking met l’accent sur le raisonnement multimodal, la compréhension vidéo à long contexte, la perception spatiale et l’OCR dans 32 langues.

Sa fenêtre de contexte atteint 262 144 tokens. Le modèle peut aussi interagir avec des interfaces PC ou mobiles et produire du Draw.io, du HTML, du CSS ou du JavaScript à partir de contenus visuels. Ses poids ouverts sous licence Apache 2.0 autorisent les usages commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres4 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest94,2 %11ᵉ / 11llm-statsAuto-déclaré
ScreenSpot92,9 %10ᵉ / 16llm-statsAuto-déclaré
MMBench-V1.186,7 %12ᵉ / 18llm-statsAuto-déclaré
MMLU-Redux86,0 %33ᵉ / 48llm-statsAuto-déclaré
AI2D84,9 %21ᵉ / 32llm-statsAuto-déclaré
WritingBench84,0 %10ᵉ / 15llm-statsAuto-déclaré
CharXiv-D83,9 %13ᵉ / 16llm-statsAuto-déclaré
InfoVQAtest83,0 %10ᵉ / 12llm-statsAuto-déclaré
IFEval82,6 %48ᵉ / 65llm-statsAuto-déclaré
MMLU81,5 %49ᵉ / 98llm-statsAuto-déclaré
OCRBench80,8 %22ᵉ / 22llm-statsAuto-déclaré
MathVista-Mini79,5 %14ᵉ / 23llm-statsAuto-déclaré
Creative Writing v376,1 %12ᵉ / 12llm-statsAuto-déclaré
MLVU-M75,7 %5ᵉ / 8llm-statsAuto-déclaré
MuirBench75,0 %5ᵉ / 11llm-statsAuto-déclaré
AIME 202574,5 %75ᵉ / 108llm-statsAuto-déclaré
CC-OCR73,8 %18ᵉ / 18llm-statsAuto-déclaré
MMLU-Pro73,6 %72ᵉ / 125llm-statsAuto-déclaré
Multi-IF73,6 %11ᵉ / 20llm-statsAuto-déclaré
MMStar73,2 %12ᵉ / 22llm-statsAuto-déclaré
RealWorldQA73,2 %18ᵉ / 25llm-statsAuto-déclaré
MMMU (val)70,8 %6ᵉ / 11llm-statsAuto-déclaré
VideoMMMU69,4 %22ᵉ / 26llm-statsAuto-déclaré
MVBench69,3 %14ᵉ / 17llm-statsAuto-déclaré
LiveBench 2024112568,4 %11ᵉ / 14llm-statsAuto-déclaré
BFCL-v367,3 %15ᵉ / 19llm-statsAuto-déclaré
MMLU-ProX65,0 %24ᵉ / 32llm-statsAuto-déclaré
Include64,6 %24ᵉ / 31llm-statsAuto-déclaré
GPQA64,1 %141ᵉ / 219llm-statsAuto-déclaré
Hallusion Bench64,1 %9ᵉ / 16llm-statsAuto-déclaré
BLINK63,4 %12ᵉ / 13llm-statsAuto-déclaré
OCRBench-V2 (en)61,8 %10ᵉ / 12llm-statsAuto-déclaré
MathVision60,0 %23ᵉ / 32llm-statsAuto-déclaré
CharadesSTA59,0 %8ᵉ / 12llm-statsAuto-déclaré
MMMU-Pro57,0 %51ᵉ / 64llm-statsAuto-déclaré
OCRBench-V2 (zh)55,8 %11ᵉ / 11llm-statsAuto-déclaré
LVBench53,5 %18ᵉ / 23llm-statsAuto-déclaré
HMMT2553,1 %22ᵉ / 25llm-statsAuto-déclaré
LiveCodeBench v651,3 %46ᵉ / 53llm-statsAuto-déclaré
CharXiv-R50,3 %41ᵉ / 45llm-statsAuto-déclaré
ScreenSpot Pro49,2 %19ᵉ / 23llm-statsAuto-déclaré
ERQA47,3 %16ᵉ / 22llm-statsAuto-déclaré
SuperGPQA46,8 %28ᵉ / 34llm-statsAuto-déclaré
PolyMATH44,6 %17ᵉ / 23llm-statsAuto-déclaré
ODinW39,4 %16ᵉ / 16llm-statsAuto-déclaré
Arena-Hard v236,8 %16ᵉ / 16llm-statsAuto-déclaré
OSWorld31,4 %15ᵉ / 20llm-statsAuto-déclaré
MM-MT-Bench7,7 %14ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
deepinfra0,1 $1 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Notre analyse

Forces. Qwen3 VL 4B Thinking combine un format relativement compact avec une large palette de fonctions multimodales. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment servent respectivement le raisonnement vidéo, la fusion de caractéristiques visuelles et la localisation temporelle d’événements. Le modèle couvre aussi l’interaction d’agent visuel sur ordinateur et mobile, la génération de code ou de diagrammes depuis des images et vidéos, ainsi que l’OCR multilingue. Sa fenêtre de 262 144 tokens favorise le traitement de séquences longues. Son principal avantage concurrentiel reste le prix : la tarification se situe 95% sous la moyenne des LLM similaires et environ 55 fois sous celle des modèles frontière.

Limites et points d'attention. Sur GPQA, qui évalue le raisonnement scientifique avancé, Qwen3 VL 4B Thinking se situait à sa sortie dans le top 53% des 130 LLM de sa génération. Ce classement le place près du milieu du marché de son époque, et non parmi les références en raisonnement scientifique. L’évaluation repose sur une source de données concordante, ce qui invite à considérer ce positionnement avec mesure. Le tarif de sortie, nettement supérieur à celui d’entrée, atteint 1 $ par million de tokens contre 0.1 $ en entrée. Le modèle cible surtout les usages multimodaux à long contexte, l’OCR, l’analyse vidéo, l’automatisation visuelle et les projets commerciaux sensibles aux coûts.


Sources des données : LLM-Stats (llm-stats.com).