Qwen2.5 VL 7B Instruct
Publié par Qwen le 26 janvier 2025, Qwen2.5 VL 7B Instruct est déjà ancien à l’échelle de l’IA : environ un an suffit à le placer derrière plusieurs générations plus récentes. Ce modèle vision-langage, ajusté pour suivre des instructions en anglais, transforme des contenus visuels et…
Publié par Qwen le 26 janvier 2025, Qwen2.5 VL 7B Instruct est déjà ancien à l’échelle de l’IA : environ un an suffit à le placer derrière plusieurs générations plus récentes. Ce modèle vision-langage, ajusté pour suivre des instructions en anglais, transforme des contenus visuels et textuels en réponses textuelles.
Son positionnement repose sur l’analyse d’images, de vidéos et d’interfaces. Il reconnaît notamment objets, textes, graphiques, icônes et mises en page, localise des éléments par boîtes ou points et peut produire des résultats structurés en JSON. Sa licence Apache 2.0 autorise les usages commerciaux avec des poids ouverts.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Grand modèle de langage (LLM) |
| Éditeur | Alibaba Cloud / Qwen Team |
| Poids | 🟢 Poids ouverts · usage commercial autorisé |
| Licence | Apache 2.0 |
| Date de sortie | 26 janvier 2025 |
| Multimodal | oui |
| Paramètres | 8 milliards |
| Fenêtre de contexte | 32 768 tokens |
| Modalités (entrée → sortie) | text,image → text |
Performances (benchmarks)
| Benchmark | Score | Rang (LLM) | Source | Fiabilité |
|---|---|---|---|---|
| DocVQA | 95,7 % | 2ᵉ / 26 | llm-stats | Auto-déclaré |
| Android Control Low_EM | 91,4 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| ChartQA | 87,3 % | 9ᵉ / 24 | llm-stats | Auto-déclaré |
| OCRBench | 86,4 % | 14ᵉ / 22 | llm-stats | Auto-déclaré |
| TextVQA | 84,9 % | 2ᵉ / 15 | llm-stats | Auto-déclaré |
| ScreenSpot | 84,7 % | 15ᵉ / 16 | llm-stats | Auto-déclaré |
| MMBench | 84,3 % | 5ᵉ / 9 | llm-stats | Auto-déclaré |
| InfoVQA | 82,6 % | 2ᵉ / 9 | llm-stats | Auto-déclaré |
| AITZ_EM | 81,9 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| CC-OCR | 77,8 % | 13ᵉ / 18 | llm-stats | Auto-déclaré |
| VideoMME w sub. | 71,6 % | 9ᵉ / 9 | llm-stats | Auto-déclaré |
| MLVU | 70,2 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| MVBench | 69,6 % | 13ᵉ / 17 | llm-stats | Auto-déclaré |
| MathVista-Mini | 68,2 % | 20ᵉ / 23 | llm-stats | Auto-déclaré |
| VideoMME w/o sub. | 65,1 % | 10ᵉ / 10 | llm-stats | Auto-déclaré |
| MMStar | 63,9 % | 19ᵉ / 22 | llm-stats | Auto-déclaré |
| MMT-Bench | 63,6 % | 1ᵉ / 4 | llm-stats | Auto-déclaré |
| Android Control High_EM | 60,1 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
| MMMU | 58,6 % | 47ᵉ / 61 | llm-stats | Auto-déclaré |
| LongVideoBench | 54,7 % | 4ᵉ / 4 | llm-stats | Auto-déclaré |
| Hallusion Bench | 52,9 % | 16ᵉ / 16 | llm-stats | Auto-déclaré |
| LVBench | 45,3 % | 21ᵉ / 23 | llm-stats | Auto-déclaré |
| CharadesSTA | 43,6 % | 12ᵉ / 12 | llm-stats | Auto-déclaré |
| MMMU-Pro | 38,3 % | 62ᵉ / 64 | llm-stats | Auto-déclaré |
| ScreenSpot Pro | 29,0 % | 23ᵉ / 23 | llm-stats | Auto-déclaré |
| AndroidWorld_SR | 25,5 % | 7ᵉ / 8 | llm-stats | Auto-déclaré |
| MathVision | 25,1 % | 31ᵉ / 32 | llm-stats | Auto-déclaré |
| MMBench-Video | 1,8 % | 3ᵉ / 3 | llm-stats | Auto-déclaré |
« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.
Notre analyse
Forces. Qwen2.5 VL 7B Instruct réunit 8 milliards de paramètres et une fenêtre de contexte de 32 768 tokens. Son architecture associe un encodeur visuel ViT doté de window attention, SwiGLU et RMSNorm à un échantillonnage vidéo à fréquence dynamique et à un alignement temporel absolu dans mRoPE. Le modèle traite plusieurs images, des vidéos et des lots, avec des entrées sous forme de fichiers locaux, de données base64 ou d’URLs. Il peut comprendre des vidéos de plus d’une heure, localiser des événements dans le temps et agir comme agent visuel sur ordinateur ou téléphone. Ses connaissances s’arrêtent au 30 juin 2024.
Limites et points d’attention. Son ancienneté constitue sa principale faiblesse. À environ un an, durée très longue dans ce secteur, ses performances sont probablement dépassées par celles de générations plus récentes, et les modèles de cette période sont souvent retirés des catalogues de leur éditeur. Son ajustement est déclaré en anglais, un point à considérer pour les usages dans d’autres langues. Enfin, l’appellation « 7B » ne correspond pas au décompte recensé de 8 milliards de paramètres, distinction utile pour estimer son format réel.
Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).