Alibaba-NLP/gte-base-en-v1.5
Publié par Alibaba le 20 juin 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-base-en-v1.5 est un modèle d'embedding anglophone de 137 millions de paramètres. Son encodeur Transformer++ combine BERT, RoPE et GLU, accepte jusqu'à 8 192 tokens et produit une représentation dense de…
Publié par Alibaba le 20 juin 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-base-en-v1.5 est un modèle d'embedding anglophone de 137 millions de paramètres. Son encodeur Transformer++ combine BERT, RoPE et GLU, accepte jusqu'à 8 192 tokens et produit une représentation dense de 768 dimensions à partir du token CLS.
Le modèle transforme les textes en vecteurs, avec normalisation L2 optionnelle, afin d'alimenter la recherche sémantique, la récupération de passages pour le RAG, la mesure de similarité et le clustering. Les comparaisons peuvent reposer sur le produit scalaire ou la similarité cosinus.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 juin 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 137 millions |
| Paramètres actifs | 137 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 54,1 % | 54ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 37,2 % | 89ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 42,4 % | 65ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 58,7 % | 47ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 19,3 % | 131ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 27,8 % | 99ᵉ / 209 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: RTEB Finance
Notre analyse
Forces. Les résultats MTEB placent ses performances les plus convaincantes sur la recherche financière et sur BEIR, qui évalue la récupération zero-shot dans des tâches et domaines hétérogènes. Le contexte maximal de 8 192 tokens facilite l'encodage de documents longs sans découpage excessif. La licence Apache 2.0 autorise l'auto-hébergement et l'intégration dans des produits commerciaux. Avec 137 millions de paramètres et des vecteurs de 768 dimensions, le modèle reste d'une taille adaptée à la création d'index denses.
Limites et points d'attention. Les résultats sont moins favorables en santé, puis nettement plus faibles dans le juridique, en allemand et surtout en français. Sa conception anglophone le rend donc peu approprié aux corpus multilingues ou principalement francophones. La dimension de 768 implique par ailleurs davantage de stockage et de calcul qu'une représentation dense plus courte. Sorti en 2024, il appartient à une génération désormais ancienne à l'échelle de l'IA, probablement dépassée par des modèles plus récents et susceptible de ne plus figurer dans les catalogues actuels. Usages pertinents : recherche sémantique, RAG, similarité et clustering sur des corpus anglais, notamment financiers ou généralistes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).