Qwen3 VL 4B Thinking
Publié par Qwen le 22 septembre 2025, Qwen3 VL 4B Thinking est un modèle vision-langage de 4 milliards de paramètres, conçu pour raisonner sur du texte, des images et des vidéos. Son édition Thinking met l’accent sur le raisonnement multimodal, la compréhension vidéo à long contexte, la…
Publié par Qwen le 22 septembre 2025, Qwen3 VL 4B Thinking est un modèle vision-langage de 4 milliards de paramètres, conçu pour raisonner sur du texte, des images et des vidéos. Son édition Thinking met l’accent sur le raisonnement multimodal, la compréhension vidéo à long contexte, la perception spatiale et l’OCR dans 32 langues.
Sa fenêtre de contexte atteint 262 144 tokens. Le modèle peut aussi interagir avec des interfaces PC ou mobiles et produire du Draw.io, du HTML, du CSS ou du JavaScript à partir de contenus visuels. Ses poids ouverts sous licence Apache 2.0 autorisent les usages commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 4 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 94,2 % | 11ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 92,9 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 86,7 % | 12ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU-Redux | 86,0 % | 33ᵉ / 48 | llm-stats | Auto-déclaré |
| AI2D | 84,9 % | 21ᵉ / 32 | llm-stats | Auto-déclaré |
| WritingBench | 84,0 % | 10ᵉ / 15 | llm-stats | Auto-déclaré |
| CharXiv-D | 83,9 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| InfoVQAtest | 83,0 % | 10ᵉ / 12 | llm-stats | Auto-déclaré |
| IFEval | 82,6 % | 48ᵉ / 65 | llm-stats | Auto-déclaré |
| MMLU | 81,5 % | 49ᵉ / 98 | llm-stats | Auto-déclaré |
| OCRBench | 80,8 % | 22ᵉ / 22 | llm-stats | Auto-déclaré |
| MathVista-Mini | 79,5 % | 14ᵉ / 23 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 76,1 % | 12ᵉ / 12 | llm-stats | Auto-déclaré |
| MLVU-M | 75,7 % | 5ᵉ / 8 | llm-stats | Auto-déclaré |
| MuirBench | 75,0 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| AIME 2025 | 74,5 % | 75ᵉ / 108 | llm-stats | Auto-déclaré |
| CC-OCR | 73,8 % | 18ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU-Pro | 73,6 % | 72ᵉ / 125 | llm-stats | Auto-déclaré |
| Multi-IF | 73,6 % | 11ᵉ / 20 | llm-stats | Auto-déclaré |
| MMStar | 73,2 % | 12ᵉ / 22 | llm-stats | Auto-déclaré |
| RealWorldQA | 73,2 % | 18ᵉ / 25 | llm-stats | Auto-déclaré |
| MMMU (val) | 70,8 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| VideoMMMU | 69,4 % | 22ᵉ / 26 | llm-stats | Auto-déclaré |
| MVBench | 69,3 % | 14ᵉ / 17 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 68,4 % | 11ᵉ / 14 | llm-stats | Auto-déclaré |
| BFCL-v3 | 67,3 % | 15ᵉ / 19 | llm-stats | Auto-déclaré |
| MMLU-ProX | 65,0 % | 24ᵉ / 32 | llm-stats | Auto-déclaré |
| Include | 64,6 % | 24ᵉ / 31 | llm-stats | Auto-déclaré |
| GPQA | 64,1 % | 141ᵉ / 219 | llm-stats | Auto-déclaré |
| Hallusion Bench | 64,1 % | 9ᵉ / 16 | llm-stats | Auto-déclaré |
| BLINK | 63,4 % | 12ᵉ / 13 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 61,8 % | 10ᵉ / 12 | llm-stats | Auto-déclaré |
| MathVision | 60,0 % | 23ᵉ / 32 | llm-stats | Auto-déclaré |
| CharadesSTA | 59,0 % | 8ᵉ / 12 | llm-stats | Auto-déclaré |
| MMMU-Pro | 57,0 % | 51ᵉ / 64 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 55,8 % | 11ᵉ / 11 | llm-stats | Auto-déclaré |
| LVBench | 53,5 % | 18ᵉ / 23 | llm-stats | Auto-déclaré |
| HMMT25 | 53,1 % | 22ᵉ / 25 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 51,3 % | 46ᵉ / 53 | llm-stats | Auto-déclaré |
| CharXiv-R | 50,3 % | 41ᵉ / 45 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 49,2 % | 19ᵉ / 23 | llm-stats | Auto-déclaré |
| ERQA | 47,3 % | 16ᵉ / 22 | llm-stats | Auto-déclaré |
| SuperGPQA | 46,8 % | 28ᵉ / 34 | llm-stats | Auto-déclaré |
| PolyMATH | 44,6 % | 17ᵉ / 23 | llm-stats | Auto-déclaré |
| ODinW | 39,4 % | 16ᵉ / 16 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 36,8 % | 16ᵉ / 16 | llm-stats | Auto-déclaré |
| OSWorld | 31,4 % | 15ᵉ / 20 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 7,7 % | 14ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| deepinfra | 0,1 $ | 1 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 95 % en dessous de la moyenne des LLM similaires, et 55 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Notre analyse
Forces. Qwen3 VL 4B Thinking combine un format relativement compact avec une large palette de fonctions multimodales. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment servent respectivement le raisonnement vidéo, la fusion de caractéristiques visuelles et la localisation temporelle d’événements. Le modèle couvre aussi l’interaction d’agent visuel sur ordinateur et mobile, la génération de code ou de diagrammes depuis des images et vidéos, ainsi que l’OCR multilingue. Sa fenêtre de 262 144 tokens favorise le traitement de séquences longues. Son principal avantage concurrentiel reste le prix : la tarification se situe 95% sous la moyenne des LLM similaires et environ 55 fois sous celle des modèles frontière.
Limites et points d'attention. Sur GPQA, qui évalue le raisonnement scientifique avancé, Qwen3 VL 4B Thinking se situait à sa sortie dans le top 53% des 130 LLM de sa génération. Ce classement le place près du milieu du marché de son époque, et non parmi les références en raisonnement scientifique. L’évaluation repose sur une source de données concordante, ce qui invite à considérer ce positionnement avec mesure. Le tarif de sortie, nettement supérieur à celui d’entrée, atteint 1 $ par million de tokens contre 0.1 $ en entrée. Le modèle cible surtout les usages multimodaux à long contexte, l’OCR, l’analyse vidéo, l’automatisation visuelle et les projets commerciaux sensibles aux coûts.
Sources des données : LLM-Stats (llm-stats.com).