Qwen3 VL 32B Thinking

Publié par Qwen le 22 septembre 2025, Qwen3 VL 32B Thinking est un modèle vision-langage de 33 milliards de paramètres, orienté vers le raisonnement multimodal. Il traite notamment les images, les vidéos, le texte, les interfaces informatiques et la perception spatiale.

Publié par Qwen le 22 septembre 2025, Qwen3 VL 32B Thinking est un modèle vision-langage de 33 milliards de paramètres, orienté vers le raisonnement multimodal. Il traite notamment les images, les vidéos, le texte, les interfaces informatiques et la perception spatiale.

Cette édition « Thinking » associe raisonnement, OCR multilingue et compréhension temporelle des vidéos. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé. Le modèle s’intègre à Hugging Face Transformers au moyen de Qwen3VLForConditionalGeneration et AutoProcessor.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie22 septembre 2025
Multimodaloui
Paramètres33 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest96,1 %5ᵉ / 11llm-statsAuto-déclaré
ScreenSpot95,7 %2ᵉ / 16llm-statsAuto-déclaré
MMLU-Redux91,9 %20ᵉ / 48llm-statsAuto-déclaré
MMBench-V1.190,8 %6ᵉ / 18llm-statsAuto-déclaré
CharXiv-D90,2 %4ᵉ / 16llm-statsAuto-déclaré
InfoVQAtest89,2 %3ᵉ / 12llm-statsAuto-déclaré
AI2D88,9 %15ᵉ / 32llm-statsAuto-déclaré
MMLU88,7 %16ᵉ / 98llm-statsAuto-déclaré
IFEval87,8 %28ᵉ / 65llm-statsAuto-déclaré
WritingBench86,2 %4ᵉ / 15llm-statsAuto-déclaré
MathVista-Mini85,9 %7ᵉ / 23llm-statsAuto-déclaré
OCRBench85,5 %15ᵉ / 22llm-statsAuto-déclaré
AIME 202583,7 %58ᵉ / 108llm-statsAuto-déclaré
Creative Writing v383,3 %9ᵉ / 12llm-statsAuto-déclaré
MM-MT-Bench83,0 %2ᵉ / 17llm-statsAuto-déclaré
MMLU-Pro82,1 %37ᵉ / 125llm-statsAuto-déclaré
MuirBench80,3 %1ᵉ / 11llm-statsAuto-déclaré
MMStar79,4 %6ᵉ / 22llm-statsAuto-déclaré
VideoMMMU79,0 %18ᵉ / 26llm-statsAuto-déclaré
RealWorldQA78,4 %13ᵉ / 25llm-statsAuto-déclaré
MMMU (val)78,1 %1ᵉ / 11llm-statsAuto-déclaré
Multi-IF78,0 %4ᵉ / 20llm-statsAuto-déclaré
VideoMME w/o sub.77,3 %7ᵉ / 10llm-statsAuto-déclaré
MMLU-ProX77,2 %15ᵉ / 32llm-statsAuto-déclaré
Include76,3 %15ᵉ / 31llm-statsAuto-déclaré
LiveBench 2024112574,7 %7ᵉ / 14llm-statsAuto-déclaré
MVBench73,2 %7ᵉ / 17llm-statsAuto-déclaré
GPQA73,1 %108ᵉ / 219llm-statsAuto-déclaré
BFCL-v371,7 %8ᵉ / 19llm-statsAuto-déclaré
MathVision70,2 %17ᵉ / 32llm-statsAuto-déclaré
BLINK68,5 %6ᵉ / 13llm-statsAuto-déclaré
OCRBench-V2 (en)68,4 %1ᵉ / 12llm-statsAuto-déclaré
MMMU-Pro68,1 %37ᵉ / 64llm-statsAuto-déclaré
Hallusion Bench67,4 %5ᵉ / 16llm-statsAuto-déclaré
LiveCodeBench v665,6 %35ᵉ / 53llm-statsAuto-déclaré
CharXiv-R65,2 %31ᵉ / 45llm-statsAuto-déclaré
AndroidWorld_SR63,7 %4ᵉ / 8llm-statsAuto-déclaré
CharadesSTA62,8 %4ᵉ / 12llm-statsAuto-déclaré
LVBench62,6 %12ᵉ / 23llm-statsAuto-déclaré
OCRBench-V2 (zh)62,1 %2ᵉ / 11llm-statsAuto-déclaré
Arena-Hard v260,5 %11ᵉ / 16llm-statsAuto-déclaré
SuperGPQA59,0 %18ᵉ / 34llm-statsAuto-déclaré
ScreenSpot Pro57,1 %17ᵉ / 23llm-statsAuto-déclaré
SimpleQA55,4 %10ᵉ / 45llm-statsAuto-déclaré
ERQA52,3 %13ᵉ / 22llm-statsAuto-déclaré
PolyMATH52,0 %11ᵉ / 23llm-statsAuto-déclaré
OSWorld41,0 %10ᵉ / 20llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. À sa sortie, Qwen3 VL 32B Thinking se situait dans le meilleur tiers des LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son principal intérêt réside dans l’étendue de ses fonctions multimodales : compréhension de vidéos longues, localisation temporelle d’événements, OCR dans 32 langues, perception spatiale 2D et 3D, et interaction avec des interfaces PC ou mobiles. Il peut aussi produire du Draw.io, du HTML, du CSS ou du JavaScript à partir d’images ou de vidéos. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment renforcent respectivement le traitement multimodal, l’alignement entre vision et texte, ainsi que l’association entre contenu et repères temporels.

Limites et points d'attention. Son classement sur GPQA le place dans une position solide, mais pas parmi l’élite de sa génération sur ce test. La synthèse repose sur une seule source de données concordante, ce qui invite à interpréter ce positionnement avec mesure. Avec 33 milliards de paramètres, il appartient en outre à une catégorie de modèles substantiels plutôt qu’aux formats les plus compacts. Qwen3 VL 32B Thinking cible surtout les usages combinant raisonnement, analyse visuelle, vidéo, OCR, interfaces et génération de contenus web structurés.


Sources des données : LLM-Stats (llm-stats.com).