Qwen2.5 VL 7B Instruct

Publié par Qwen le 26 janvier 2025, Qwen2.5 VL 7B Instruct est déjà ancien à l’échelle de l’IA : environ un an suffit à le placer derrière plusieurs générations plus récentes. Ce modèle vision-langage, ajusté pour suivre des instructions en anglais, transforme des contenus visuels et…

Publié par Qwen le 26 janvier 2025, Qwen2.5 VL 7B Instruct est déjà ancien à l’échelle de l’IA : environ un an suffit à le placer derrière plusieurs générations plus récentes. Ce modèle vision-langage, ajusté pour suivre des instructions en anglais, transforme des contenus visuels et textuels en réponses textuelles.

Son positionnement repose sur l’analyse d’images, de vidéos et d’interfaces. Il reconnaît notamment objets, textes, graphiques, icônes et mises en page, localise des éléments par boîtes ou points et peut produire des résultats structurés en JSON. Sa licence Apache 2.0 autorise les usages commerciaux avec des poids ouverts.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceApache 2.0
Date de sortie26 janvier 2025
Multimodaloui
Paramètres8 milliards
Fenêtre de contexte32 768 tokens
Modalités (entrée → sortie)text,image → text

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQA95,7 %2ᵉ / 26llm-statsAuto-déclaré
Android Control Low_EM91,4 %3ᵉ / 3llm-statsAuto-déclaré
ChartQA87,3 %9ᵉ / 24llm-statsAuto-déclaré
OCRBench86,4 %14ᵉ / 22llm-statsAuto-déclaré
TextVQA84,9 %2ᵉ / 15llm-statsAuto-déclaré
ScreenSpot84,7 %15ᵉ / 16llm-statsAuto-déclaré
MMBench84,3 %5ᵉ / 9llm-statsAuto-déclaré
InfoVQA82,6 %2ᵉ / 9llm-statsAuto-déclaré
AITZ_EM81,9 %3ᵉ / 3llm-statsAuto-déclaré
CC-OCR77,8 %13ᵉ / 18llm-statsAuto-déclaré
VideoMME w sub.71,6 %9ᵉ / 9llm-statsAuto-déclaré
MLVU70,2 %10ᵉ / 10llm-statsAuto-déclaré
MVBench69,6 %13ᵉ / 17llm-statsAuto-déclaré
MathVista-Mini68,2 %20ᵉ / 23llm-statsAuto-déclaré
VideoMME w/o sub.65,1 %10ᵉ / 10llm-statsAuto-déclaré
MMStar63,9 %19ᵉ / 22llm-statsAuto-déclaré
MMT-Bench63,6 %1ᵉ / 4llm-statsAuto-déclaré
Android Control High_EM60,1 %3ᵉ / 3llm-statsAuto-déclaré
MMMU58,6 %47ᵉ / 61llm-statsAuto-déclaré
LongVideoBench54,7 %4ᵉ / 4llm-statsAuto-déclaré
Hallusion Bench52,9 %16ᵉ / 16llm-statsAuto-déclaré
LVBench45,3 %21ᵉ / 23llm-statsAuto-déclaré
CharadesSTA43,6 %12ᵉ / 12llm-statsAuto-déclaré
MMMU-Pro38,3 %62ᵉ / 64llm-statsAuto-déclaré
ScreenSpot Pro29,0 %23ᵉ / 23llm-statsAuto-déclaré
AndroidWorld_SR25,5 %7ᵉ / 8llm-statsAuto-déclaré
MathVision25,1 %31ᵉ / 32llm-statsAuto-déclaré
MMBench-Video1,8 %3ᵉ / 3llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Qwen2.5 VL 7B Instruct réunit 8 milliards de paramètres et une fenêtre de contexte de 32 768 tokens. Son architecture associe un encodeur visuel ViT doté de window attention, SwiGLU et RMSNorm à un échantillonnage vidéo à fréquence dynamique et à un alignement temporel absolu dans mRoPE. Le modèle traite plusieurs images, des vidéos et des lots, avec des entrées sous forme de fichiers locaux, de données base64 ou d’URLs. Il peut comprendre des vidéos de plus d’une heure, localiser des événements dans le temps et agir comme agent visuel sur ordinateur ou téléphone. Ses connaissances s’arrêtent au 30 juin 2024.

Limites et points d’attention. Son ancienneté constitue sa principale faiblesse. À environ un an, durée très longue dans ce secteur, ses performances sont probablement dépassées par celles de générations plus récentes, et les modèles de cette période sont souvent retirés des catalogues de leur éditeur. Son ajustement est déclaré en anglais, un point à considérer pour les usages dans d’autres langues. Enfin, l’appellation « 7B » ne correspond pas au décompte recensé de 8 milliards de paramètres, distinction utile pour estimer son format réel.


Sources des données : LLM-Stats (llm-stats.com) · OpenRouter (openrouter.ai).