Qwen3 VL 8B Instruct
Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Instruct est un modèle vision-langage de 9 milliards de paramètres, proposé sous licence Apache 2.0 avec des poids ouverts et un usage commercial autorisé. Sa fenêtre de contexte de 262 144 tokens cible notamment les longues vidéos et les…
Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Instruct est un modèle vision-langage de 9 milliards de paramètres, proposé sous licence Apache 2.0 avec des poids ouverts et un usage commercial autorisé. Sa fenêtre de contexte de 262 144 tokens cible notamment les longues vidéos et les documents volumineux.
Cette édition Instruct associe texte, images et vidéos. Ses architectures Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment soutiennent l’alignement image-texte, la localisation temporelle et le raisonnement vidéo long horizon. Ses usages couvrent aussi l’OCR en 32 langues, les interfaces PC et mobiles, la perception spatiale et la génération de Draw.io ou de code web à partir de contenus visuels.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 9 milliards |
| Fenêtre de contexte | 262 144 tokens |
| Modalités (entrée → sortie) | text,image,video → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 96,1 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 94,4 % | 7ᵉ / 16 | llm-stats | Auto-déclaré |
| OCRBench | 89,6 % | 6ᵉ / 22 | llm-stats | Auto-déclaré |
| AI2D | 85,7 % | 19ᵉ / 32 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 85,0 % | 14ᵉ / 18 | llm-stats | Auto-déclaré |
| MMLU-Redux | 84,9 % | 34ᵉ / 48 | llm-stats | Auto-déclaré |
| IFEval | 83,7 % | 44ᵉ / 65 | llm-stats | Auto-déclaré |
| InfoVQAtest | 83,1 % | 9ᵉ / 12 | llm-stats | Auto-déclaré |
| WritingBench | 83,1 % | 11ᵉ / 15 | llm-stats | Auto-déclaré |
| CharXiv-D | 83,0 % | 14ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU | 80,7 % | 54ᵉ / 98 | llm-stats | Auto-déclaré |
| CC-OCR | 79,9 % | 11ᵉ / 18 | llm-stats | Auto-déclaré |
| MLVU-M | 78,1 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| MathVista-Mini | 77,2 % | 15ᵉ / 23 | llm-stats | Auto-déclaré |
| Multi-IF | 75,1 % | 9ᵉ / 20 | llm-stats | Auto-déclaré |
| MMLU-Pro | 71,6 % | 75ᵉ / 125 | llm-stats | Auto-déclaré |
| RealWorldQA | 71,5 % | 19ᵉ / 25 | llm-stats | Auto-déclaré |
| Video-MME | 71,4 % | 15ᵉ / 17 | llm-stats | Auto-déclaré |
| MMStar | 70,9 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| MMMU (val) | 69,6 % | 7ᵉ / 11 | llm-stats | Auto-déclaré |
| BLINK | 69,1 % | 4ᵉ / 13 | llm-stats | Auto-déclaré |
| MVBench | 68,7 % | 17ᵉ / 17 | llm-stats | Auto-déclaré |
| Include | 67,0 % | 23ᵉ / 31 | llm-stats | Auto-déclaré |
| BFCL-v3 | 66,3 % | 16ᵉ / 19 | llm-stats | Auto-déclaré |
| MMLU-ProX | 65,4 % | 23ᵉ / 32 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 65,4 % | 5ᵉ / 12 | llm-stats | Auto-déclaré |
| VideoMMMU | 65,3 % | 24ᵉ / 26 | llm-stats | Auto-déclaré |
| MuirBench | 64,4 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 62,0 % | 13ᵉ / 14 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 61,2 % | 4ᵉ / 11 | llm-stats | Auto-déclaré |
| Hallusion Bench | 61,1 % | 13ᵉ / 16 | llm-stats | Auto-déclaré |
| LVBench | 58,0 % | 15ᵉ / 23 | llm-stats | Auto-déclaré |
| CharadesSTA | 56,0 % | 9ᵉ / 12 | llm-stats | Auto-déclaré |
| MMMU-Pro | 55,9 % | 52ᵉ / 64 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 54,6 % | 18ᵉ / 23 | llm-stats | Auto-déclaré |
| MathVision | 53,9 % | 25ᵉ / 32 | llm-stats | Auto-déclaré |
| CharXiv-R | 46,4 % | 43ᵉ / 45 | llm-stats | Auto-déclaré |
| AIME 2025 | 45,9 % | 101ᵉ / 108 | llm-stats | Auto-déclaré |
| ERQA | 45,8 % | 18ᵉ / 22 | llm-stats | Auto-déclaré |
| ODinW | 44,7 % | 8ᵉ / 16 | llm-stats | Auto-déclaré |
| SuperGPQA | 44,5 % | 30ᵉ / 34 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 39,3 % | 51ᵉ / 53 | llm-stats | Auto-déclaré |
| OSWorld | 33,9 % | 12ᵉ / 20 | llm-stats | Auto-déclaré |
| HMMT25 | 32,5 % | 24ᵉ / 25 | llm-stats | Auto-déclaré |
| PolyMATH | 30,4 % | 20ᵉ / 23 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 7,7 % | 14ᵉ / 17 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Tarifs
| Fournisseur | Entrée / 1M | Sortie / 1M | Cache lecture / 1M |
|---|---|---|---|
| Alibaba Cloud Int. | 0,117 $ | 0,455 $ | n.d. |
Prix en dollars US par million de tokens.
Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 47 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).
Coût & vitesse agentiques
| Indicateur | Valeur |
|---|---|
| Coût moyen par benchmark — Benchable | 0,01 $ |
| Latence moyenne par benchmark — Benchable | 1 h 31 min |
Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.
Notre analyse
Forces. Qwen3 VL 8B Instruct obtient ses résultats les plus solides en Ethics, General Knowledge et Email Classification, avec des scores bruts élevés. Coding constitue également un point fort plus mesuré. Sa longue fenêtre de contexte et ses fonctions multimodales le destinent à l’analyse de documents, de vidéos et d’interfaces, ainsi qu’à l’extraction de texte multilingue. À sa sortie, il se situait dans le top 49% des LLM de sa génération sur MMLU-Pro, soit dans la première moitié sans appartenir au groupe de tête. Son principal avantage pratique reste son coût très économique, inférieur de 94% à la moyenne des LLM similaires et environ 47 fois plus bas que celui des modèles frontière.
Limites et points d'attention. Les rangs obtenus sur Benchable nuancent les scores bruts élevés : le modèle reste éloigné des premières places, y compris en connaissances générales, classification d’e-mails et code. Reasoning se situe dans la partie basse du classement, tandis que Hallucinations constitue sa faiblesse la plus nette, avec un résultat et un rang défavorables. Ces écarts imposent une validation des réponses lorsque l’exactitude factuelle ou le raisonnement complexe sont déterminants. Qwen3 VL 8B Instruct vise ainsi surtout les usages multimodaux à budget contraint, avec contrôle des résultats pour les tâches sensibles.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).