Qwen2.5 VL 32B Instruct
Sorti le 28 février 2025, Qwen2.5 VL 32B Instruct est déjà ancien à l’échelle de l’IA, où une année suffit à séparer plusieurs générations. Ce modèle vision-langage de Qwen compte 34 milliards de paramètres et associe traitement du texte, des images, des graphiques, des mises en page et…
Sorti le 28 février 2025, Qwen2.5 VL 32B Instruct est déjà ancien à l’échelle de l’IA, où une année suffit à séparer plusieurs générations. Ce modèle vision-langage de Qwen compte 34 milliards de paramètres et associe traitement du texte, des images, des graphiques, des mises en page et des vidéos longues.
Sa particularité réside dans l’analyse visuelle structurée : il localise des objets par boîtes englobantes ou points et produit leurs coordonnées et attributs en JSON. Sa fenêtre de contexte atteint 128 000 tokens. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 28 février 2025 |
| Multimodal | oui |
| Paramètres | 34 milliards |
| Fenêtre de contexte | 128 000 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 94,8 % | 6ᵉ / 26 | llm-stats | Auto-déclaré |
| Android Control Low_EM | 93,3 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| HumanEval | 91,5 % | 10ᵉ / 65 | llm-stats | Auto-déclaré |
| ScreenSpot | 88,5 % | 11ᵉ / 16 | llm-stats | Auto-déclaré |
| MBPP | 84,0 % | 7ᵉ / 33 | llm-stats | Auto-déclaré |
| InfoVQA | 83,4 % | 1ᵉ / 9 | llm-stats | Auto-déclaré |
| AITZ_EM | 83,1 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
| MATH | 82,2 % | 18ᵉ / 70 | llm-stats | Auto-déclaré |
| MMLU | 78,4 % | 68ᵉ / 98 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 77,9 % | 7ᵉ / 9 | llm-stats | Auto-déclaré |
| CC-OCR | 77,1 % | 15ᵉ / 18 | llm-stats | Auto-déclaré |
| MathVista-Mini | 74,7 % | 17ᵉ / 23 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 70,5 % | 9ᵉ / 10 | llm-stats | Auto-déclaré |
| MMMU | 70,0 % | 30ᵉ / 61 | llm-stats | Auto-déclaré |
| Android Control High_EM | 69,6 % | 1ᵉ / 3 | llm-stats | Auto-déclaré |
| MMStar | 69,5 % | 17ᵉ / 22 | llm-stats | Auto-déclaré |
| MMLU-Pro | 68,8 % | 84ᵉ / 125 | llm-stats | Auto-déclaré |
| OCRBench-V2 (zh) | 59,1 % | 8ᵉ / 11 | llm-stats | Auto-déclaré |
| OCRBench-V2 (en) | 57,2 % | 12ᵉ / 12 | llm-stats | Auto-déclaré |
| CharadesSTA | 54,2 % | 11ᵉ / 12 | llm-stats | Auto-déclaré |
| MMMU-Pro | 49,5 % | 57ᵉ / 64 | llm-stats | Auto-déclaré |
| LVBench | 49,0 % | 19ᵉ / 23 | llm-stats | Auto-déclaré |
| GPQA | 46,0 % | 174ᵉ / 219 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 39,4 % | 22ᵉ / 23 | llm-stats | Auto-déclaré |
| MathVision | 38,4 % | 28ᵉ / 32 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 22,0 % | 8ᵉ / 8 | llm-stats | Auto-déclaré |
| OSWorld | 5,9 % | 20ᵉ / 20 | llm-stats | Auto-déclaré |
| MMBench-Video | 1,9 % | 2ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Classements Arena (Elo)
Arena Vision · 135 modèles classés
| Rang | Modèle | Elo |
|---|---|---|
| 1ᵉ | Claude Fable 5 | 1318 |
| 2ᵉ | Claude Opus 4.7 | 1304 |
| 3ᵉ | Claude Opus 4.6 | 1299 |
| ⋯ | ⋯ | |
| 98ᵉ | step-1o-vision-32k-highres | 1125 |
| 99ᵉ | Qwen2.5 VL 72B Instruct | 1121 |
| 100ᵉ | Qwen2.5 VL 32B Instruct | 1120 |
| 101ᵉ | gemini-1.5-pro-001 | 1119 |
| 102ᵉ | GPT-4o | 1119 |
Notre analyse
Forces. À sa sortie, Qwen2.5 VL 32B Instruct se plaçait dans la moitié supérieure des LLM de sa génération sur GPQA. Sa polyvalence visuelle reste son principal intérêt : analyse d’images, de textes intégrés, de graphiques, d’icônes, de mises en page, de plusieurs images et de vidéos. La résolution dynamique s’étend au temps grâce à un échantillonnage FPS dynamique et à mRoPE pour l’alignement temporel. L’encodeur visuel ViT combine window attention, SwiGLU et RMSNorm. Le modèle accepte aussi des contenus visuels par base64, URL ou séquences entrelacées, avec inférence en batch via Transformers.
Limites et points d’attention. Son âge pèse fortement sur sa pertinence actuelle : ses performances sont désormais largement dépassées par les générations récentes, et les versions de cette période sont souvent retirées des catalogues des éditeurs. Son classement dans Arena vision se situe près du bas du tableau, très loin du modèle en tête, ce qui limite son intérêt face aux systèmes visuels haut de gamme. Ses connaissances s’arrêtent au 30 juin 2024, une coupure sensible pour les sujets récents. Même à sa sortie, son résultat sur GPQA le situait seulement dans la moitié supérieure de sa génération, sans en faire une référence dominante en raisonnement.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).