Alibaba-NLP/gte-Qwen2-1.5B-instruct

Publié par Alibaba le 29 juillet 2024, Alibaba-NLP/gte-Qwen2-1.5B-instruct est un modèle d’embedding dense multilingue de la famille GTE, construit sur Qwen2-1.5B. Ses 2 milliards de paramètres, tous actifs, produisent des vecteurs de 8 960 dimensions. Distribué sous licence ouverte…

Publié par Alibaba le 29 juillet 2024, Alibaba-NLP/gte-Qwen2-1.5B-instruct est un modèle d’embedding dense multilingue de la famille GTE, construit sur Qwen2-1.5B. Ses 2 milliards de paramètres, tous actifs, produisent des vecteurs de 8 960 dimensions. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Il combine attention bidirectionnelle et réglage par instruction côté requête, après un entraînement multilingue couvrant plusieurs domaines avec des données supervisées et faiblement supervisées.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie29 juillet 2024
Dimension du vecteur8 960
Représentationdense
Paramètres2 milliards
Paramètres actifs2 milliards
Longueur de séquence max32 768 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR58,3 %20ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval44,1 %53ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal45,1 %63ᵉ / 208mteb✅ Mesuré
MTEB: Medical65,0 %3ᵉ / 158mteb✅ Mesuré
MTEB: Legal55,6 %24ᵉ / 157mteb✅ Mesuré
MTEB: European61,8 %15ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French50,6 %42ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,9 %67ᵉ / 209mteb✅ Mesuré
MTEB: Chinese67,1 %31ᵉ / 58mteb✅ Mesuré
MTEB: French66,1 %12ᵉ / 117mteb✅ Mesuré
MTEB: Indic60,4 %24ᵉ / 119mteb✅ Mesuré
MTEB: Thai38,0 %25ᵉ / 28mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Le domaine médical constitue son principal point fort dans MTEB, avec un classement parmi les tout meilleurs pour la recherche d’informations cliniques, biomédicales et de santé grand public. Les résultats en français et sur l’ensemble European le placent également dans le haut du classement, ce qui soutient les usages multilingues de classification, de clustering, de recherche et de rapprochement de textes. Sur BEIR, son rang témoigne aussi d’une bonne capacité de retrieval zero-shot dans des tâches et domaines hétérogènes. La licence Apache 2.0 facilite l’intégration et l’auto-hébergement, tandis que la compatibilité déclarée avec Sentence Transformers, Transformers et infinity_emb offre plusieurs voies de déploiement.

Limites et points d'attention. Les performances relatives sont moins marquantes sur les ensembles Chinese et Indic que sur les tracks médical, français et European. La dimension de sortie de 8 960 alourdit les index vectoriels, augmente les besoins de stockage et peut rendre la recherche plus coûteuse que chez des modèles produisant des vecteurs plus compacts. Sorti il y a près de deux ans, il appartient à une génération déjà ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche médicale, RAG multilingue, recherche sémantique en français et en langues européennes, similarité documentaire et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).