Qwen3 VL 32B Thinking
Publié par Qwen le 22 septembre 2025, Qwen3 VL 32B Thinking est un modèle vision-langage de 33 milliards de paramètres, orienté vers le raisonnement multimodal. Il traite notamment les images, les vidéos, le texte, les interfaces informatiques et la perception spatiale.
Publié par Qwen le 22 septembre 2025, Qwen3 VL 32B Thinking est un modèle vision-langage de 33 milliards de paramètres, orienté vers le raisonnement multimodal. Il traite notamment les images, les vidéos, le texte, les interfaces informatiques et la perception spatiale.
Cette édition « Thinking » associe raisonnement, OCR multilingue et compréhension temporelle des vidéos. Ses poids sont distribués sous licence Apache 2.0, avec usage commercial autorisé. Le modèle s’intègre à Hugging Face Transformers au moyen de Qwen3VLForConditionalGeneration et AutoProcessor.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 22 septembre 2025 |
| Multimodal | oui |
| Paramètres | 33 milliards |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQAtest | 96,1 % | 5ᵉ / 11 | llm-stats | Auto-déclaré |
| ScreenSpot | 95,7 % | 2ᵉ / 16 | llm-stats | Auto-déclaré |
| MMLU-Redux | 91,9 % | 20ᵉ / 48 | llm-stats | Auto-déclaré |
| MMBench-V1.1 | 90,8 % | 6ᵉ / 18 | llm-stats | Auto-déclaré |
| CharXiv-D | 90,2 % | 4ᵉ / 16 | llm-stats | Auto-déclaré |
| InfoVQAtest | 89,2 % | 3ᵉ / 12 | llm-stats | Auto-déclaré |
| AI2D | 88,9 % | 15ᵉ / 32 | llm-stats | Auto-déclaré |
| MMLU | 88,7 % | 16ᵉ / 98 | llm-stats | Auto-déclaré |
| IFEval | 87,8 % | 28ᵉ / 65 | llm-stats | Auto-déclaré |
| WritingBench | 86,2 % | 4ᵉ / 15 | llm-stats | Auto-déclaré |
| MathVista-Mini | 85,9 % | 7ᵉ / 23 | llm-stats | Auto-déclaré |
| OCRBench | 85,5 % | 15ᵉ / 22 | llm-stats | Auto-déclaré |
| AIME 2025 | 83,7 % | 58ᵉ / 108 | llm-stats | Auto-déclaré |
| Creative Writing v3 | 83,3 % | 9ᵉ / 12 | llm-stats | Auto-déclaré |
| MM-MT-Bench | 83,0 % | 2ᵉ / 17 | llm-stats | Auto-déclaré |
| MMLU-Pro | 82,1 % | 37ᵉ / 125 | llm-stats | Auto-déclaré |
| MuirBench | 80,3 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| MMStar | 79,4 % | 6ᵉ / 22 | llm-stats | Auto-déclaré |
| VideoMMMU | 79,0 % | 18ᵉ / 26 | llm-stats | Auto-déclaré |
| RealWorldQA | 78,4 % | 13ᵉ / 25 | llm-stats | Auto-déclaré |
| MMMU (val) | 78,1 % | 1ᵉ / 11 | llm-stats | Auto-déclaré |
| Multi-IF | 78,0 % | 4ᵉ / 20 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 77,3 % | 7ᵉ / 10 | llm-stats | Auto-déclaré |
| MMLU-ProX | 77,2 % | 15ᵉ / 32 | llm-stats | Auto-déclaré |
| Include | 76,3 % | 15ᵉ / 31 | llm-stats | Auto-déclaré |
| LiveBench 20241125 | 74,7 % | 7ᵉ / 14 | llm-stats | Auto-déclaré |
| MVBench | 73,2 % | 7ᵉ / 17 | llm-stats | Auto-déclaré |
| GPQA | 73,1 % | 108ᵉ / 219 | llm-stats | Auto-déclaré |
| BFCL-v3 | 71,7 % | 8ᵉ / 19 | llm-stats | Auto-déclaré |
| MathVision | 70,2 % | 17ᵉ / 32 | llm-stats | Auto-déclaré |
| BLINK | 68,5 % | 6ᵉ / 13 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 68,4 % | 1ᵉ / 12 | llm-stats | Auto-déclaré |
| MMMU-Pro | 68,1 % | 37ᵉ / 64 | llm-stats | Auto-déclaré |
| Hallusion Bench | 67,4 % | 5ᵉ / 16 | llm-stats | Auto-déclaré |
| LiveCodeBench v6 | 65,6 % | 35ᵉ / 53 | llm-stats | Auto-déclaré |
| CharXiv-R | 65,2 % | 31ᵉ / 45 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 63,7 % | 4ᵉ / 8 | llm-stats | Auto-déclaré |
| CharadesSTA | 62,8 % | 4ᵉ / 12 | llm-stats | Auto-déclaré |
| LVBench | 62,6 % | 12ᵉ / 23 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 62,1 % | 2ᵉ / 11 | llm-stats | Auto-déclaré |
| Arena-Hard v2 | 60,5 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| SuperGPQA | 59,0 % | 18ᵉ / 34 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 57,1 % | 17ᵉ / 23 | llm-stats | Auto-déclaré |
| SimpleQA | 55,4 % | 10ᵉ / 45 | llm-stats | Auto-déclaré |
| ERQA | 52,3 % | 13ᵉ / 22 | llm-stats | Auto-déclaré |
| PolyMATH | 52,0 % | 11ᵉ / 23 | llm-stats | Auto-déclaré |
| OSWorld | 41,0 % | 10ᵉ / 20 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. À sa sortie, Qwen3 VL 32B Thinking se situait dans le meilleur tiers des LLM de sa génération sur GPQA, un benchmark consacré aux questions scientifiques complexes. Son principal intérêt réside dans l’étendue de ses fonctions multimodales : compréhension de vidéos longues, localisation temporelle d’événements, OCR dans 32 langues, perception spatiale 2D et 3D, et interaction avec des interfaces PC ou mobiles. Il peut aussi produire du Draw.io, du HTML, du CSS ou du JavaScript à partir d’images ou de vidéos. Interleaved-MRoPE, DeepStack et Text–Timestamp Alignment renforcent respectivement le traitement multimodal, l’alignement entre vision et texte, ainsi que l’association entre contenu et repères temporels.
Limites et points d'attention. Son classement sur GPQA le place dans une position solide, mais pas parmi l’élite de sa génération sur ce test. La synthèse repose sur une seule source de données concordante, ce qui invite à interpréter ce positionnement avec mesure. Avec 33 milliards de paramètres, il appartient en outre à une catégorie de modèles substantiels plutôt qu’aux formats les plus compacts. Qwen3 VL 32B Thinking cible surtout les usages combinant raisonnement, analyse visuelle, vidéo, OCR, interfaces et génération de contenus web structurés.
Sources des données : LLM-Stats (llm-stats.com).