Alibaba-NLP/gme-Qwen2-VL-7B-Instruct
Alibaba-NLP/gme-Qwen2-VL-7B-Instruct est un modèle d’embedding multimodal d’Alibaba, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres, tous actifs, produisent des vecteurs denses unifiés de 3 584 dimensions à partir d’un texte, d’une image ou d’une paire image-texte.
Alibaba-NLP/gme-Qwen2-VL-7B-Instruct est un modèle d’embedding multimodal d’Alibaba, publié sous licence ouverte Apache 2.0. Ses 8 milliards de paramètres, tous actifs, produisent des vecteurs denses unifiés de 3 584 dimensions à partir d’un texte, d’une image ou d’une paire image-texte.
Fondé sur Qwen2-VL et entraîné uniquement en anglais, il accepte une seule image par entrée, avec au plus 1 024 jetons visuels. Il sert à la recherche sémantique, au RAG, à la mesure de similarité et au clustering, y compris entre modalités ou avec fusion du texte et de l’image.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 24 décembre 2024 |
| Dimension du vecteur | 3 584 |
| Représentation | vecteur dense unifié, en mode monomodal (texte ou image) ou multimodal fusionné (paire image-texte) |
| Paramètres | 8 milliards |
| Paramètres actifs | 8 milliards |
| Longueur de séquence max | 32 768 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,7 % | 33ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Chinese | 70,7 % | 18ᵉ / 58 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Chinese
Notre analyse
Forces. Le modèle se place dans le groupe supérieur sur MTEB Chinese, pour des tâches comprenant la recherche, le reranking et la classification de paires. Son classement sur BEIR indique également une bonne aptitude à la recherche zero-shot dans des domaines et scénarios hétérogènes. Sa représentation commune prend en charge les recherches texte-texte, texte-image et image-image, ainsi que les requêtes associant les deux modalités. Les instructions appliquées aux requêtes et la résolution dynamique des images facilitent l’adaptation aux cas de recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes propriétaires.
Limites et points d'attention. L’entraînement exclusivement anglophone invite à la prudence malgré le positionnement obtenu sur MTEB Chinese. L’entrée limitée à une image et à 1 024 jetons visuels restreint les traitements portant sur plusieurs visuels ou des contenus visuels très longs. Les vecteurs de 3 584 dimensions alourdissent les index et rendent la recherche plus coûteuse, tandis que les 8 milliards de paramètres actifs imposent une exécution substantielle. Sorti il y a environ deux ans, il est ancien à l’échelle de l’IA et probablement dépassé par des modèles plus récents de sa catégorie. Usages pertinents : recherche multimodale, RAG avec textes et images, déduplication, similarité et clustering de contenus anglophones.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).