Alibaba-NLP/gte-modernbert-base

Alibaba-NLP/gte-modernbert-base est un modèle d’embedding publié par Alibaba le 21 janvier 2025 sous licence ouverte Apache 2.0. Fondé sur l’encodeur ModernBERT-base, il compte 149 millions de paramètres actifs et produit une représentation dense de 768 dimensions par pooling du token CLS.

Alibaba-NLP/gte-modernbert-base est un modèle d’embedding publié par Alibaba le 21 janvier 2025 sous licence ouverte Apache 2.0. Fondé sur l’encodeur ModernBERT-base, il compte 149 millions de paramètres actifs et produit une représentation dense de 768 dimensions par pooling du token CLS.

Principalement anglophone, il accepte jusqu’à 8 192 tokens, une capacité adaptée à la représentation de documents longs. Ses vecteurs, qui peuvent être normalisés pour mesurer leur similarité, servent notamment à la recherche sémantique, à la sélection de passages pour le RAG et au clustering de textes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie21 janvier 2025
Dimension du vecteur768
Représentationdense (vecteur unique via pooling CLS)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,2 %40ᵉ / 192mteb✅ Mesuré
MTEB: Code Information Retrieval71,1 %21ᵉ / 49mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ Alibaba-NLP/gte-modernb…55 %

MTEB: Code Information Retrieval

Qodo/Qodo-Embed-1-7B71 %
▶ Alibaba-NLP/gte-modernb…71 %
Shuu12121/NightOwl-Code…69 %

Notre analyse

Forces. Le résultat obtenu sur BEIR place le modèle dans le groupe de tête pour la recherche zero-shot sur des tâches et domaines hétérogènes. Son autre évaluation MTEB indique aussi une aptitude correcte à retrouver des informations dans des contenus techniques variés. La fenêtre de 8 192 tokens facilite l’indexation de textes longs avec moins de découpage. Les vecteurs denses de 768 dimensions offrent un format relativement contenu pour le stockage et la recherche, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d’attention. Son classement sur la recherche technique reste en retrait des meilleurs modèles de ce track, et sa performance sur BEIR ne le place pas au tout premier rang. Sa langue principale étant l’anglais, son emploi sur des corpus multilingues appelle une validation spécifique. Sorti il y a environ un an, il appartient à une génération déjà ancienne à l’échelle de l’IA, potentiellement dépassée par des modèles plus récents et parfois retirée des catalogues. Usages pertinents : recherche documentaire anglophone, RAG sur documents longs, similarité sémantique et clustering auto-hébergé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).