Alibaba-NLP/gte-multilingual-base

Publié par Alibaba le 20 juillet 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-multilingual-base est un modèle d’embedding encoder-only de 305 millions de paramètres actifs. Il couvre plus de 70 langues et accepte des séquences atteignant 8 192 tokens.

Publié par Alibaba le 20 juillet 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-multilingual-base est un modèle d’embedding encoder-only de 305 millions de paramètres actifs. Il couvre plus de 70 langues et accepte des séquences atteignant 8 192 tokens.

Le modèle produit des représentations denses élastiques de 128 à 768 dimensions, avec une dimension maximale de sortie de 768, ainsi que des vecteurs creux. Il sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Son déploiement est prévu avec Transformers, sentence-transformers, Infinity et Text Embeddings Inference.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie20 juillet 2024
Dimension du vecteur768
Représentationdense élastique + creuse (sparse)
Paramètres305 millions
Paramètres actifs305 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,1 %91ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL43,4 %7ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval62,1 %31ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal44,8 %65ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare57,6 %42ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance55,3 %58ᵉ / 97mteb✅ Mesuré
MTEB: Medical57,0 %31ᵉ / 158mteb✅ Mesuré
MTEB: Legal54,5 %32ᵉ / 157mteb✅ Mesuré
MTEB: European59,0 %23ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French48,0 %52ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German45,7 %68ᵉ / 209mteb✅ Mesuré
MTEB: Korean69,3 %9ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Alibaba-NLP/gte-multili…51 %
dwzhu/e5-base-4k50 %

MTEB: BEIR-NL

bge-m345 %
▶ Alibaba-NLP/gte-multili…43 %

Notre analyse

Forces. Alibaba-NLP/gte-multilingual-base se distingue surtout sur MTEB Korean, où il figure dans le top 10 pour des tâches mêlant classification, reranking et retrieval. Ses résultats sur MTEB European confirment son intérêt pour les corpus multilingues, tandis que Long-context Retrieval montre une aptitude solide à retrouver des informations dans des documents étendus. La séquence de 8 192 tokens facilite l’indexation de contenus longs. Les sorties denses élastiques permettent aussi d’arbitrer entre précision et poids de l’index, tandis que les vecteurs creux offrent une autre représentation exploitable. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux.

Limites et points d'attention. Les résultats sont moins convaincants dans les domaines spécialisés : Medical et RTEB Healthcare se situent derrière les meilleurs modèles de leurs classements, et RTEB Finance constitue le track le plus faible présenté. Une sortie dense de 768 dimensions alourdit l’index et augmente le coût de la recherche par rapport aux dimensions élastiques plus compactes. Sorti il y a environ deux ans, le modèle est ancien à l’échelle de l’IA, probablement dépassé par des générations récentes, et les modèles de sa période sont souvent retirés des catalogues éditeurs. Usages pertinents : recherche multilingue, RAG sur documents longs, similarité et clustering avec déploiement auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).