Alibaba-NLP/gme-Qwen2-VL-2B-Instruct

Publié par Alibaba le 24 décembre 2024, Alibaba-NLP/gme-Qwen2-VL-2B-Instruct est un modèle d’embedding de 2 milliards de paramètres actifs, fondé sur Qwen2-VL. Il produit des vecteurs denses de 1 536 dimensions représentant du texte, une image ou une paire image-texte fusionnée.

Publié par Alibaba le 24 décembre 2024, Alibaba-NLP/gme-Qwen2-VL-2B-Instruct est un modèle d’embedding de 2 milliards de paramètres actifs, fondé sur Qwen2-VL. Il produit des vecteurs denses de 1 536 dimensions représentant du texte, une image ou une paire image-texte fusionnée.

Entraîné uniquement sur des données en anglais, il accepte une seule image et jusqu’à 1 024 jetons visuels, avec une résolution dynamique. Il sert à la recherche sémantique, au RAG multimodal, à la mesure de similarité et au clustering. Sa licence ouverte Apache 2.0 autorise l’auto-hébergement et l’adaptation.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie24 décembre 2024
Dimension du vecteur1 536
Représentationdense multimodale unifiée : texte, image et paire image-texte fusionnée
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR53,4 %58ᵉ / 192mteb✅ Mesuré
MTEB: Chinese68,0 %25ᵉ / 58mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Alibaba-NLP/gme-Qwen2-V…53 %
w601sxs/b1ade-embed53 %

MTEB: Chinese

▶ Alibaba-NLP/gme-Qwen2-V…68 %

Notre analyse

Forces. Le modèle couvre dans un même espace vectoriel les recherches texte-texte, texte-image, image-texte et image-image, ainsi que les requêtes associant texte et image. Les instructions d’embedding permettent d’orienter la représentation selon la tâche. Sur MTEB Chinese, son classement dans la première moitié indique une qualité solide pour les tâches évaluées de recherche, de reranking et de classification de paires en chinois, malgré un entraînement exclusivement anglophone. Sur MTEB BEIR, il se situe dans le premier tiers pour la recherche zero-shot sur des domaines et tâches hétérogènes. La licence Apache 2.0 constitue un atout pour le déploiement autonome.

Limites et points d'attention. Sa représentation de 1 536 dimensions alourdit davantage les index et les calculs de similarité que des embeddings de plus petite dimension. Le traitement visuel reste limité à une seule image et à 1 024 jetons visuels. Son entraînement uniquement en anglais invite à la prudence pour les corpus multilingues, même si le résultat MTEB Chinese est favorable. Avec environ deux ans d’ancienneté, il appartient à une génération déjà très ancienne à l’échelle de l’IA, potentiellement dépassée par des modèles plus récents et souvent retirée des catalogues éditeurs. Usages pertinents : recherche sémantique et RAG multimodaux anglophones, rapprochement texte-image, similarité et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).