Qwen3 VL 8B Thinking

Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Thinking est un modèle vision-langage de 9 milliards de paramètres, doté d’une fenêtre de contexte de 262 144 tokens. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé.

Publié par Qwen le 22 septembre 2025, Qwen3 VL 8B Thinking est un modèle vision-langage de 9 milliards de paramètres, doté d’une fenêtre de contexte de 262 144 tokens. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé.

Cette édition Thinking associe texte, images et vidéos. Elle intègre Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment pour la fusion de caractéristiques visuelles, le raisonnement vidéo et la localisation temporelle. Ses usages couvrent notamment les interfaces PC et mobiles, la génération de Draw.io, HTML, CSS ou JavaScript à partir de contenus visuels, la perception spatiale, les documents longs et l’OCR en 32 langues.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres9 milliards
Fenêtre de contexte262 144 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest95,3 %7ᵉ / 11llm-statsAuto-déclaré
ScreenSpot93,6 %9ᵉ / 16llm-statsAuto-déclaré
MMLU-Redux88,8 %28ᵉ / 48llm-statsAuto-déclaré
MMBench-V1.187,5 %10ᵉ / 18llm-statsAuto-déclaré
InfoVQAtest86,0 %6ᵉ / 12llm-statsAuto-déclaré
CharXiv-D85,9 %10ᵉ / 16llm-statsAuto-déclaré
WritingBench85,5 %5ᵉ / 15llm-statsAuto-déclaré
MMLU85,2 %39ᵉ / 98llm-statsAuto-déclaré
AI2D84,9 %21ᵉ / 32llm-statsAuto-déclaré
IFEval83,2 %46ᵉ / 65llm-statsAuto-déclaré
Creative Writing v382,4 %11ᵉ / 12llm-statsAuto-déclaré
OCRBench81,9 %19ᵉ / 22llm-statsAuto-déclaré
MathVista-Mini81,4 %12ᵉ / 23llm-statsAuto-déclaré
AIME 202580,3 %66ᵉ / 108llm-statsAuto-déclaré
MMLU-Pro77,3 %62ᵉ / 125llm-statsAuto-déclaré
MuirBench76,8 %4ᵉ / 11llm-statsAuto-déclaré
CC-OCR76,3 %16ᵉ / 18llm-statsAuto-déclaré
MMStar75,3 %11ᵉ / 22llm-statsAuto-déclaré
MLVU-M75,1 %7ᵉ / 8llm-statsAuto-déclaré
Multi-IF75,1 %9ᵉ / 20llm-statsAuto-déclaré
MMMU (val)74,1 %5ᵉ / 11llm-statsAuto-déclaré
RealWorldQA73,5 %17ᵉ / 25llm-statsAuto-déclaré
VideoMMMU72,8 %21ᵉ / 26llm-statsAuto-déclaré
Video-MME71,8 %14ᵉ / 17llm-statsAuto-déclaré
MMLU-ProX70,7 %22ᵉ / 32llm-statsAuto-déclaré
GPQA69,9 %118ᵉ / 219llm-statsAuto-déclaré
LiveBench 2024112569,8 %10ᵉ / 14llm-statsAuto-déclaré
Include69,5 %22ᵉ / 31llm-statsAuto-déclaré
MVBench69,0 %15ᵉ / 17llm-statsAuto-déclaré
BLINK68,7 %5ᵉ / 13llm-statsAuto-déclaré
Hallusion Bench65,4 %8ᵉ / 16llm-statsAuto-déclaré
OCRBench-V2 (en)63,9 %6ᵉ / 12llm-statsAuto-déclaré
BFCL-v363,0 %19ᵉ / 19llm-statsAuto-déclaré
MathVision62,7 %21ᵉ / 32llm-statsAuto-déclaré
HMMT2560,6 %18ᵉ / 25llm-statsAuto-déclaré
MMMU-Pro60,4 %46ᵉ / 64llm-statsAuto-déclaré
CharadesSTA59,9 %7ᵉ / 12llm-statsAuto-déclaré
OCRBench-V2 (zh)59,2 %6ᵉ / 11llm-statsAuto-déclaré
LiveCodeBench v658,6 %38ᵉ / 53llm-statsAuto-déclaré
LVBench55,8 %17ᵉ / 23llm-statsAuto-déclaré
CharXiv-R53,0 %39ᵉ / 45llm-statsAuto-déclaré
SuperGPQA51,2 %27ᵉ / 34llm-statsAuto-déclaré
Arena-Hard v251,1 %14ᵉ / 16llm-statsAuto-déclaré
SimpleQA49,6 %15ᵉ / 45llm-statsAuto-déclaré
PolyMATH47,5 %15ᵉ / 23llm-statsAuto-déclaré
ERQA46,8 %17ᵉ / 22llm-statsAuto-déclaré
ScreenSpot Pro46,6 %20ᵉ / 23llm-statsAuto-déclaré
ODinW39,8 %15ᵉ / 16llm-statsAuto-déclaré
OSWorld33,9 %12ᵉ / 20llm-statsAuto-déclaré
MM-MT-Bench8,0 %11ᵉ / 17llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Tarifs

FournisseurEntrée / 1MSortie / 1MCache lecture / 1M
Alibaba Cloud Int.0,117 $1,365 $n.d.

Prix en dollars US par million de tokens.

Sa tarification se situe 94 % en dessous de la moyenne des LLM similaires, et 47 fois moins cher que les modèles frontières (Claude Fable 5, GPT-5.6 Sol, Gemini 3.5 Flash).

Coût & vitesse agentiques

IndicateurValeur
Coût moyen par benchmark — Benchable0,13 $
Latence moyenne par benchmark — Benchable2 h 11 min

Coûts et durées réels mesurés en exécutant le modèle comme agent. PinchBench = un run complet de 147 tâches (harness OpenClaw) ; Benchable = moyenne par benchmark. Sources : PinchBench, Benchable.ai.

Notre analyse

Forces. La classification d’e-mails constitue son résultat le plus convaincant sur Benchable, avec un score élevé et un classement dans le premier tiers environ. À sa sortie, Qwen3 VL 8B Thinking figurait aussi dans le top 39% des LLM de sa génération sur GPQA, ce qui le situait au-dessus d’une majorité de modèles contemporains sur cette évaluation. Son autre avantage majeur est économique : sa tarification se place 94% sous la moyenne des LLM similaires et environ 47 fois sous celle des modèles frontière. La fenêtre de 262 144 tokens complète ce positionnement pour le traitement de contenus longs.

Limites et points d’attention. Les résultats Benchable sont nettement moins favorables en programmation, en raisonnement et en mathématiques, avec des classements proches du bas des panels évalués. Le suivi d’instructions reste dans la seconde moitié du classement, tandis que l’évaluation des hallucinations place également le modèle parmi les moins bien classés. Ce profil limite son intérêt pour les tâches exigeant une forte fiabilité logique, mathématique ou factuelle. Qwen3 VL 8B Thinking convient surtout aux usages multimodaux sensibles au coût, à l’OCR multilingue, aux documents longs et à la classification d’e-mails, avec validation des sorties lorsque la précision est critique.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Benchable.ai (benchable.ai).