QvQ-72B-Preview

Publié par Qwen le 25 décembre 2024, QvQ-72B-Preview est un LLM expérimental de 73 milliards de paramètres consacré au raisonnement visuel. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles…

Publié par Qwen le 25 décembre 2024, QvQ-72B-Preview est un LLM expérimental de 73 milliards de paramètres consacré au raisonnement visuel. Près de deux ans après sa sortie, il appartient déjà à une génération ancienne à l’échelle de l’IA, aujourd’hui largement dépassée par les modèles plus récents.

Le modèle traite des images fournies par URL, en base64 ou au sein de contenus intercalés. Ses poids sont ouverts sous licence Qwen, avec un usage commercial autorisé. Son positionnement reste celui d’un prototype de recherche plutôt que d’un système généraliste abouti.

Caractéristiques

CaractéristiqueValeur
TypeGrand modèle de langage (LLM)
ÉditeurAlibaba Cloud / Qwen Team
Poids🟢 Poids ouverts · usage commercial autorisé
LicenceQwen
Date de sortie25 décembre 2024
Multimodaloui
Paramètres73 milliards

Performances (benchmarks)

BenchmarkScoreRang (LLM)SourceFiabilité
MathVista71,4 %13ᵉ / 38llm-statsAuto-déclaré
MMMU70,3 %28ᵉ / 61llm-statsAuto-déclaré
MathVision35,9 %30ᵉ / 32llm-statsAuto-déclaré

« Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench). Le rang est calculé parmi les LLM évalués sur le même benchmark.

Notre analyse

Forces. QvQ-72B-Preview concentre ses 73 milliards de paramètres sur l’amélioration du raisonnement visuel. Il accepte plusieurs modes d’intégration des images, notamment les URL, le base64 et les contenus intercalés, ce qui facilite son emploi dans différents formats de requêtes multimodales. Il fonctionne comme modèle de chat avec transformers et qwen_vl_utils. L’ouverture de ses poids et l’autorisation d’un usage commercial permettent aussi son déploiement et son adaptation dans le cadre fixé par la licence Qwen.

Limites et points d'attention. Le modèle ne gère que les dialogues à un seul tour et les sorties image, sans prise en charge des entrées vidéo. Son raisonnement peut mélanger les langues, entrer dans des boucles récursives ou perdre de vue le contenu de l’image lors d’analyses visuelles en plusieurs étapes. Ces défauts réduisent sa fiabilité pour les échanges prolongés et les tâches visuelles complexes. Son statut expérimental et son ancienneté d’environ deux ans le situent désormais parmi les modèles de recherche historiques, dont les performances sont largement dépassées par les générations actuelles.


Sources des données : LLM-Stats (llm-stats.com).