Alibaba-NLP/gte-multilingual-base
Publié par Alibaba le 20 juillet 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-multilingual-base est un modèle d’embedding encoder-only de 305 millions de paramètres actifs. Il couvre plus de 70 langues et accepte des séquences atteignant 8 192 tokens.
Publié par Alibaba le 20 juillet 2024 sous licence ouverte Apache 2.0, Alibaba-NLP/gte-multilingual-base est un modèle d’embedding encoder-only de 305 millions de paramètres actifs. Il couvre plus de 70 langues et accepte des séquences atteignant 8 192 tokens.
Le modèle produit des représentations denses élastiques de 128 à 768 dimensions, avec une dimension maximale de sortie de 768, ainsi que des vecteurs creux. Il sert à indexer des textes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Son déploiement est prévu avec Transformers, sentence-transformers, Infinity et Text Embeddings Inference.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 20 juillet 2024 |
| Dimension du vecteur | 768 |
| Représentation | dense élastique + creuse (sparse) |
| Paramètres | 305 millions |
| Paramètres actifs | 305 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,1 % | 91ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 43,4 % | 7ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 62,1 % | 31ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 44,8 % | 65ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 57,6 % | 42ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 55,3 % | 58ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 57,0 % | 31ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 54,5 % | 32ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 59,0 % | 23ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 48,0 % | 52ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 45,7 % | 68ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Korean | 69,3 % | 9ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Alibaba-NLP/gte-multilingual-base se distingue surtout sur MTEB Korean, où il figure dans le top 10 pour des tâches mêlant classification, reranking et retrieval. Ses résultats sur MTEB European confirment son intérêt pour les corpus multilingues, tandis que Long-context Retrieval montre une aptitude solide à retrouver des informations dans des documents étendus. La séquence de 8 192 tokens facilite l’indexation de contenus longs. Les sorties denses élastiques permettent aussi d’arbitrer entre précision et poids de l’index, tandis que les vecteurs creux offrent une autre représentation exploitable. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des services commerciaux.
Limites et points d'attention. Les résultats sont moins convaincants dans les domaines spécialisés : Medical et RTEB Healthcare se situent derrière les meilleurs modèles de leurs classements, et RTEB Finance constitue le track le plus faible présenté. Une sortie dense de 768 dimensions alourdit l’index et augmente le coût de la recherche par rapport aux dimensions élastiques plus compactes. Sorti il y a environ deux ans, le modèle est ancien à l’échelle de l’IA, probablement dépassé par des générations récentes, et les modèles de sa période sont souvent retirés des catalogues éditeurs. Usages pertinents : recherche multilingue, RAG sur documents longs, similarité et clustering avec déploiement auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).