Thenlper: GTE-Base

Thenlper: GTE-Base est un modèle d’embedding textuel d’Alibaba publié sous licence ouverte MIT. Fondé principalement sur BERT, il compte 109 millions de paramètres et produit des vecteurs denses de 768 dimensions par average pooling, avec normalisation L2 optionnelle.

Thenlper: GTE-Base est un modèle d’embedding textuel d’Alibaba publié sous licence ouverte MIT. Fondé principalement sur BERT, il compte 109 millions de paramètres et produit des vecteurs denses de 768 dimensions par average pooling, avec normalisation L2 optionnelle.

Le modèle traite exclusivement des textes anglais, tronqués à 512 tokens. Entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de plusieurs domaines, il sert à la recherche sémantique, à la récupération de contenus pour le RAG, à la mesure de similarité, au clustering et au reranking.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie18 novembre 2025
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,1 %89ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,8 %100ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal32,4 %123ᵉ / 208mteb✅ Mesuré
MTEB: Medical40,4 %71ᵉ / 158mteb✅ Mesuré
MTEB: Legal40,0 %78ᵉ / 157mteb✅ Mesuré
MTEB: European47,5 %73ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French23,9 %114ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German15,7 %142ᵉ / 209mteb✅ Mesuré
MTEB: French49,6 %61ᵉ / 117mteb✅ Mesuré
MTEB: German40,9 %47ᵉ / 96mteb✅ Mesuré
MTEB: Indic32,0 %95ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,005 $

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent BEIR, consacré à la recherche zero-shot sur des tâches et domaines hétérogènes, ainsi que le track French. Le modèle se situe également dans la première moitié du classement German. Ses 109 millions de paramètres et ses vecteurs de 768 dimensions offrent un format relativement contenu pour constituer des index sémantiques. La licence MIT facilite l’auto-hébergement et l’intégration, tandis que la compatibilité avec Transformers et Sentence Transformers simplifie le déploiement. Son tarif d’entrée, positionné 89 % sous la moyenne des modèles d’embedding similaires, constitue aussi un atout pour les traitements volumineux.

Limites et points d’attention. Malgré ses résultats sur plusieurs tracks linguistiques de MTEB, le modèle prend exclusivement en charge l’anglais. Les textes sont tronqués à 512 tokens, ce qui impose un découpage des documents longs avant indexation. Les tracks Medical et Legal figurent dans la moitié inférieure de leurs classements respectifs, comme European, ce qui invite à valider la qualité sur des corpus spécialisés ou multilingues. Les vecteurs de 768 dimensions impliquent par ailleurs un coût de stockage et de recherche supérieur à celui de représentations moins dimensionnées. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, similarité, clustering et reranking à coût économique.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).