Qwen3 VL 8B Thinking
Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Thinking est un modèle vision-langage de 9 milliards de paramètres, doté d’une fenêtre de contexte de 262 144 tokens. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé.
Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Thinking est un modèle vision-langage de 9 milliards de paramètres, doté d’une fenêtre de contexte de 262 144 tokens. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé.
Cette édition Thinking associe texte, images et vidéos. Elle intègre Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment pour la fusion de caractéristiques visuelles, le raisonnement vidéo et la localisation temporelle. Ses usages couvrent notamment les interfaces PC et mobiles, la génération de Draw.io, HTML, CSS ou JavaScript à partir de contenus visuels, la perception spatiale, les documents longs et l’OCR en 32 langues.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 9 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 95,3 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 93,6 % | 9ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Redux | 88,8 % | 28ᵉ / 48 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 87,5 % | 10ᵉ / 18 | llm-stats | Auto-déclaré |
| InfoVQAtest | 86,0 % | 6ᵉ / 12 | llm-stats | Auto-déclaré |
| CharXiv-D | 85,9 % | 10ᵉ / 16 | llm-stats | Auto-déclaré |
| WritingBench | 85,5 % | 5ᵉ / 15 | llm-stats | Auto-déclaré |
| MMLU | 85,2 % | 39ᵉ / 98 | llm-stats | Auto-déclaré |
| AI2D | 84,9 % | 21ᵉ / 32 | llm-stats | Auto-déclaré |
| IFEval | 83,2 % | 46ᵉ / 65 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 82,4 % | 11ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench | 81,9 % | 19ᵉ / 22 | llm-stats | Auto-déclaré |
| MathVista-Mini | 81,4 % | 12ᵉ / 23 | llm-stats | Auto-déclaré |
| AIME 2025 | 80,3 % | 66ᵉ / 108 | llm-stats | Auto-déclaré |
| MMLU-Pro | 77,3 % | 62ᵉ / 125 | llm-stats | Auto-déclaré |
| MuirBench | 76,8 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| CC-OCR | 76,3 % | 16ᵉ / 18 | llm-stats | Auto-déclaré |
| MMStar | 75,3 % | 11ᵉ / 22 | llm-stats | Auto-déclaré |
| MLVU-M | 75,1 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| Multi-IF | 75,1 % | 9ᵉ / 20 | llm-stats | Auto-déclaré |
| MMMU (val) | 74,1 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| RealWorldQA | 73,5 % | 17ᵉ / 25 | llm-stats | Auto-déclaré |
| VideoMMMU | 72,8 % | 21ᵉ / 26 | llm-stats | Auto-déclaré |
| Video-MME | 71,8 % | 14ᵉ / 17 | llm-stats | Auto-déclaré |
| MMLU-ProX | 70,7 % | 22ᵉ / 32 | llm-stats | Auto-déclaré |
| GPQA | 69,9 % | 118ᵉ / 219 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 69,8 % | 10ᵉ / 14 | llm-stats | Auto-déclaré |
| Include | 69,5 % | 22ᵉ / 31 | llm-stats | Auto-déclaré |
| MVBench | 69,0 % | 15ᵉ / 17 | llm-stats | Auto-déclaré |
| BLINK | 68,7 % | 5ᵉ / 13 | llm-stats | Auto-déclaré |
| Hallusion Bench | 65,4 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 63,9 % | 6ᵉ / 12 | llm-stats | Auto-déclaré |
| BFCL-v3 | 63,0 % | 19ᵉ / 19 | llm-stats | Auto-déclaré |
| MathVision | 62,7 % | 21ᵉ / 32 | llm-stats | Auto-déclaré |
| HMMT25 | 60,6 % | 18ᵉ / 25 | llm-stats | Auto-déclaré |
| MMMU-Pro | 60,4 % | 46ᵉ / 64 | llm-stats | Auto-déclaré |
| CharadesSTA | 59,9 % | 7ᵉ / 12 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 59,2 % | 6ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 58,6 % | 38ᵉ / 53 | llm-stats | Auto-déclaré |
| LVBench | 55,8 % | 17ᵉ / 23 | llm-stats | Auto-déclaré |
| CharXiv-R | 53,0 % | 39ᵉ / 45 | llm-stats | Auto-déclaré |
| SuperGPQA | 51,2 % | 27ᵉ / 34 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 51,1 % | 14ᵉ / 16 | llm-stats | Auto-déclaré |
| SimpleQA | 49,6 % | 15ᵉ / 45 | llm-stats | Auto-déclaré |
| PolyMATH | 47,5 % | 15ᵉ / 23 | llm-stats | Auto-déclaré |
| ERQA | 46,8 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 46,6 % | 20ᵉ / 23 | llm-stats | Auto-déclaré |
| ODinW | 39,8 % | 15ᵉ / 16 | llm-stats | Auto-déclaré |
| OSWorld | 33,9 % | 12ᵉ / 20 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 8,0 % | 11ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,117 $ | 1,365 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 47 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,13 $ |
| Latence moyenne par benchmark — Benchable | 2 h 11 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. La classification d’e-mails constitue son résultat le plus convaincant sur Benchable, avec un score élevé et un classement dans le premier tiers environ. À sa sortie, Qwen3 VL 8B Thinking figurait aussi dans le top 39% des LLM de sa génération sur GPQA, ce qui le situait au-dessus d’une majorité de modèles contemporains sur cette évaluation. Son autre avantage majeur est économique : sa tarification se place 94% sous la moyenne des LLM similaires et environ 47 fois sous celle des modèles frontière. La fenêtre de 262 144 tokens complète ce positionnement pour le traitement de contenus longs.
Limites et points d’attention. Les résultats Benchable sont nettement moins favorables en programmation, en raisonnement et en mathématiques, avec des classements proches du bas des panels évalués. Le suivi d’instructions reste dans la seconde moitié du classement, tandis que l’évaluation des hallucinations place également le modèle parmi les moins bien classés. Ce profil limite son intérêt pour les tâches exigeant une forte fiabilité logique, mathématique ou factuelle. Qwen3 VL 8B Thinking convient surtout aux usages multimodaux sensibles au coût, à l’OCR multilingue, aux documents longs et à la classification d’e-mails, avec validation des sorties lorsque la précision est critique.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).