Alibaba-NLP/gme-Qwen2-VL-7B-Instruct

Alibaba-NLP/gme-Qwen2-VL-7B-Instruct est un modèle d’embedding multimodal d’Alibaba, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres, tous actifs, produisent des vecteurs denses unifiés de 3 584 dimensions à partir d’un texte, d’une image ou d’une paire image-texte.

Alibaba-NLP/gme-Qwen2-VL-7B-Instruct est un modèle d’embedding multimodal d’Alibaba, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres, tous actifs, produisent des vecteurs denses unifiés de 3 584 dimensions à partir d’un texte, d’une image ou d’une paire image-texte.

Fondé sur Qwen2-VL et entraîné uniquement en anglais, il accepte une seule image par entrée, avec au plus 1 024 jetons visuels. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, y compris entre modalités ou avec fusion du texte et de l’image.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie24 décembre 2024
Dimension du vecteur3 584
Représentationvecteur dense unifié, en mode monomodal (texte ou image) ou multimodal fusionné (paire image-texte)
Paramètres8 milliards
Paramètres actifs8 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,7 %33ᵉ / 192mteb✅ Mesuré
MTEB: Chinese70,7 %18ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Alibaba-NLP/gme-Qwen2-V…56 %

MTEB: Chinese

sensenova/piccolo-large…71 %
▶ Alibaba-NLP/gme-Qwen2-V…71 %
Classical/Yinka71 %

Notre analyse

Forces. Le modèle se place dans le groupe supérieur sur MTEB Chinese, pour des tâches comprenant la recherche, le reranking et la classification de paires. Son classement sur BEIR indique également une bonne aptitude à la recherche zero-shot dans des domaines et scénarios hétérogènes. Sa représentation commune prend en charge les recherches texte-texte, texte-image et image-image, ainsi que les requêtes associant les deux modalités. Les instructions appliquées aux requêtes et la résolution dynamique des images facilitent l’adaptation aux cas de recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.

Limites et points d'attention. L’entraînement exclusivement anglophone invite à la prudence malgré le positionnement obtenu sur MTEB Chinese. L’entrée limitée à une image et à 1 024 jetons visuels restreint les traitements portant sur plusieurs visuels ou des contenus visuels très longs. Les vecteurs de 3 584 dimensions alourdissent les index et rendent la recherche plus coûteuse, tandis que les 8 milliards de paramètres actifs imposent une exécution substantielle. Sorti il y a environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche multimodale, RAG avec textes et images, déduplication, similarité et clustering de contenus anglophones.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).