Qwen2-VL-72B-Instruct

Publié par Qwen le 29 août 2024, Qwen2-VL-72B-Instruct est un LLM multimodal de 73 milliards de paramètres, ajusté pour suivre des instructions à partir de texte, d’images et de vidéos. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et…

Publié par Qwen le 29 août 2024, Qwen2-VL-72B-Instruct est un LLM multimodal de 73 milliards de paramètres, ajusté pour suivre des instructions à partir de texte, d’images et de vidéos. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé par des modèles plus récents.

Son architecture adapte le nombre de tokens visuels à la résolution des images. Son encodage positionnel M-ROPE articule le texte en 1D, l’image en 2D et la vidéo en 3D. Le modèle comprend aussi des vidéos de plus de 20 minutes et du texte présent dans des images en plusieurs langues.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial restreint (recherche / non commercial)
Licencetongyi-qianwen
Date de sortie29 août 2024
Connaissances jusqu'à2023-06-30
Multimodaloui
Paramètres73 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
DocVQAtest96,5 %3ᵉ / 11llm-statsAuto-déclaré
ChartQA88,3 %6ᵉ / 24llm-statsAuto-déclaré
OCRBench87,7 %12ᵉ / 22llm-statsAuto-déclaré
MMBench86,5 %4ᵉ / 9llm-statsAuto-déclaré
TextVQA85,5 %1ᵉ / 15llm-statsAuto-déclaré
InfoVQAtest84,5 %8ᵉ / 12llm-statsAuto-déclaré
EgoSchema77,9 %1ᵉ / 9llm-statsAuto-déclaré
RealWorldQA77,8 %14ᵉ / 25llm-statsAuto-déclaré
MVBench73,6 %6ᵉ / 17llm-statsAuto-déclaré
MathVista-Mini70,5 %19ᵉ / 23llm-statsAuto-déclaré
MMMUval64,5 %4ᵉ / 4llm-statsAuto-déclaré
MMMU-Pro46,2 %58ᵉ / 64llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. Qwen2-VL-72B-Instruct réunit dans un même modèle le traitement du texte, des images et des vidéos. La résolution dynamique évite de représenter toutes les images par un nombre fixe de tokens visuels, tandis que M-ROPE prend en compte la structure propre à chaque modalité. Le modèle peut interpréter des vidéos de plus de 20 minutes et lire du texte dans des images, notamment en anglais, chinois, langues européennes, japonais, coréen, arabe et vietnamien. Il peut être intégré à des téléphones mobiles ou à des robots afin d’exécuter des opérations fondées sur l’environnement visuel et des consignes textuelles. Son utilisation avec transformers et qwen-vl-utils couvre les images, les vidéos, les URL, les données en base64 et les entrées visuelles entrelacées.

Limites et points d’attention. Son ancienneté, très importante dans ce secteur, réduit aujourd’hui sa pertinence face aux modèles multimodaux plus récents. Ses connaissances s’arrêtent au 30 juin 2023, ce qui limite son adéquation aux sujets contemporains. Ses poids ne sont pas ouverts sous la licence tongyi-qianwen. Enfin, ses 73 milliards de paramètres impliquent un modèle de grande taille, tandis que cette fiche repose sur une seule source de données concordante.


Sources des données : LLM-Stats (llm-stats.com).