Qwen2.5 VL 32B Instruct

Sorti le 28 février 2025, Qwen2.5 VL 32B Instruct est déjà ancien à l’échelle de l’IA, où une année suffit à séparer plusieurs générations. Ce modèle vision-langage de Qwen compte 34 milliards de paramètres et associe traitement du texte, des images, des graphiques, des mises en page et…

Sorti le 28 février 2025, Qwen2.5 VL 32B Instruct est déjà ancien à l’échelle de l’IA, où une année suffit à séparer plusieurs générations. Ce modèle vision-langage de Qwen compte 34 milliards de paramètres et associe traitement du texte, des images, des graphiques, des mises en page et des vidéos longues.

Sa particularité réside dans l’analyse visuelle structurée : il localise des objets par boîtes englobantes ou points et produit leurs coordonnées et attributs en JSON. Sa fenêtre de contexte atteint 128 000 tokens. Ses poids ouverts sous licence Apache 2.0 autorisent l’usage commercial.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie28 février 2025
Multimodaloui
Paramètres34 milliards
Fenêtre de contexte128 000 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA94,8 %6ᵉ / 26llm-statsAuto-déclaré
Android Control Low_EM93,3 %2ᵉ / 3llm-statsAuto-déclaré
HumanEval91,5 %10ᵉ / 65llm-statsAuto-déclaré
ScreenSpot88,5 %11ᵉ / 16llm-statsAuto-déclaré
MBPP84,0 %7ᵉ / 33llm-statsAuto-déclaré
InfoVQA83,4 %1ᵉ / 9llm-statsAuto-déclaré
AITZ_EM83,1 %2ᵉ / 3llm-statsAuto-déclaré
MATH82,2 %18ᵉ / 70llm-statsAuto-déclaré
MMLU78,4 %68ᵉ / 98llm-statsAuto-déclaré
VideoMME w sub.77,9 %7ᵉ / 9llm-statsAuto-déclaré
CC-OCR77,1 %15ᵉ / 18llm-statsAuto-déclaré
MathVista-Mini74,7 %17ᵉ / 23llm-statsAuto-déclaré
VideoMME w/o sub.70,5 %9ᵉ / 10llm-statsAuto-déclaré
MMMU70,0 %30ᵉ / 61llm-statsAuto-déclaré
Android Control High_EM69,6 %1ᵉ / 3llm-statsAuto-déclaré
MMStar69,5 %17ᵉ / 22llm-statsAuto-déclaré
MMLU-Pro68,8 %84ᵉ / 125llm-statsAuto-déclaré
OCRBench-V2 (zh)59,1 %8ᵉ / 11llm-statsAuto-déclaré
OCRBench-V2 (en)57,2 %12ᵉ / 12llm-statsAuto-déclaré
CharadesSTA54,2 %11ᵉ / 12llm-statsAuto-déclaré
MMMU-Pro49,5 %57ᵉ / 64llm-statsAuto-déclaré
LVBench49,0 %19ᵉ / 23llm-statsAuto-déclaré
GPQA46,0 %174ᵉ / 219llm-statsAuto-déclaré
ScreenSpot Pro39,4 %22ᵉ / 23llm-statsAuto-déclaré
MathVision38,4 %28ᵉ / 32llm-statsAuto-déclaré
AndroidWorld_SR22,0 %8ᵉ / 8llm-statsAuto-déclaré
OSWorld5,9 %20ᵉ / 20llm-statsAuto-déclaré
MMBench-Video1,9 %2ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Classements Arena (Elo)

Arena Vision · 135 modèles classés

RangModèleElo
1ᵉClaude Fable 51318
2ᵉClaude Opus 4.71304
3ᵉClaude Opus 4.61299
98ᵉstep-1o-vision-32k-highres1125
99ᵉQwen2.5 VL 72B Instruct1121
100ᵉQwen2.5 VL 32B Instruct1120
101ᵉgemini-1.5-pro-0011119
102ᵉGPT-4o1119

Notre analyse

Forces. À sa sortie, Qwen2.5 VL 32B Instruct se plaçait dans la moitié supérieure des LLM de sa génération sur GPQA. Sa polyvalence visuelle reste son principal intérêt : analyse d’images, de textes intégrés, de graphiques, d’icônes, de mises en page, de plusieurs images et de vidéos. La résolution dynamique s’étend au temps grâce à un échantillonnage FPS dynamique et à mRoPE pour l’alignement temporel. L’encodeur visuel ViT combine window attention, SwiGLU et RMSNorm. Le modèle accepte aussi des contenus visuels par base64, URL ou séquences entrelacées, avec inférence en batch via Transformers.

Limites et points d’attention. Son âge pèse fortement sur sa pertinence actuelle : ses performances sont désormais largement dépassées par les générations récentes, et les versions de cette période sont souvent retirées des catalogues des éditeurs. Son classement dans Arena vision se situe près du bas du tableau, très loin du modèle en tête, ce qui limite son intérêt face aux systèmes visuels haut de gamme. Ses connaissances s’arrêtent au 30 juin 2024, une coupure sensible pour les sujets récents. Même à sa sortie, son résultat sur GPQA le situait seulement dans la moitié supérieure de sa génération, sans en faire une référence dominante en raisonnement.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai) · Arena.ai (arena.ai).