Alibaba-NLP/gte-base-en-v1.5

Publié par Alibaba le 20 juin 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-base-en-v1.5 est un modèle d'embedding anglophone de 137 millions de paramètres. Son encodeur Transformer++ combine BERT, RoPE et GLU, accepte jusqu'à 8 192 tokens et produit une représentation dense de…

Publié par Alibaba le 20 juin 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-base-en-v1.5 est un modèle d'embedding anglophone de 137 millions de paramètres. Son encodeur Transformer++ combine BERT, RoPE et GLU, accepte jusqu'à 8 192 tokens et produit une représentation dense de 768 dimensions à partir du token CLS.

Le modèle transforme les textes en vecteurs, avec normalisation L2 optionnelle, afin d'alimenter la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité et le clustering. Les comparaisons peuvent reposer sur le produit scalaire ou la similarité cosinus.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie20 juin 2024
Dimension du vecteur768
Représentationdense
Paramètres137 millions
Paramètres actifs137 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,1 %54ᵉ / 192mteb✅ Mesuré
MTEB: RTEB Legal37,2 %89ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare42,4 %65ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance58,7 %47ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French19,3 %131ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German27,8 %99ᵉ / 209mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

jxm/cde-small-v254 %
▶ Alibaba-NLP/gte-base-en…54 %
MongoDB/mdbr-leaf-ir54 %

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
▶ Alibaba-NLP/gte-base-en…59 %

Notre analyse

Forces. Les résultats MTEB placent ses performances les plus convaincantes sur la recherche financière et sur BEIR, qui évalue la récupération zero-shot dans des tâches et domaines hétérogènes. Le contexte maximal de 8 192 tokens facilite l'encodage de documents longs sans découpage excessif. La licence Apache 2.0 autorise l'auto-hébergement et l'intégration dans des produits commerciaux. Avec 137 millions de paramètres et des vecteurs de 768 dimensions, le modèle reste d'une taille adaptée à la création d'index denses.

Limites et points d'attention. Les résultats sont moins favorables en santé, puis nettement plus faibles dans le juridique, en allemand et surtout en français. Sa conception anglophone le rend donc peu approprié aux corpus multilingues ou principalement francophones. La dimension de 768 implique par ailleurs davantage de stockage et de calcul qu'une représentation dense plus courte. Sorti en 2024, il appartient à une génération désormais ancienne à l'échelle de l'IA, probablement dépassée par des modèles plus récents et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus anglais, notamment financiers ou généralistes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).