thenlper/gte-small

thenlper/gte-small est un modèle d’embedding dense publié par Alibaba le 27 juillet 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 33 millions de paramètres, tous actifs, et convertit les textes en vecteurs de 384 dimensions. Il accepte jusqu’à 512 tokens et…

thenlper/gte-small est un modèle d’embedding dense publié par Alibaba le 27 juillet 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 33 millions de paramètres, tous actifs, et convertit les textes en vecteurs de 384 dimensions. Il accepte jusqu’à 512 tokens et traite exclusivement l’anglais.

Entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de domaines variés, il applique un pooling moyen des états cachés, avec normalisation L2 optionnelle. Il sert à la recherche sémantique, au RAG, à la similarité, au clustering et au reranking, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurAlibaba
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 juillet 2023
Dimension du vecteur384
Représentationdense
Paramètres33 millions
Paramètres actifs33 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR49,5 %104ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval34,5 %102ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal31,0 %135ᵉ / 208mteb✅ Mesuré
MTEB: Medical38,5 %87ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,9 %79ᵉ / 157mteb✅ Mesuré
MTEB: European46,7 %81ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French18,5 %134ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German14,7 %147ᵉ / 209mteb✅ Mesuré
MTEB: French49,1 %66ᵉ / 117mteb✅ Mesuré
MTEB: German40,1 %54ᵉ / 96mteb✅ Mesuré
MTEB: Indic31,5 %104ᵉ / 119mteb✅ Mesuré
MTEB: Russian26,2 %76ᵉ / 104mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les résultats MTEB les plus favorables concernent BEIR et le track French, ce qui met surtout en avant la recherche d’information et, dans une moindre mesure, des tâches de classification, de clustering et de comparaison de paires. Le track European reste proche de ces résultats, malgré une conception limitée à l’anglais. Ses 384 dimensions permettent des index vectoriels plus légers qu’avec des représentations de grande dimension. La licence MIT facilite l’auto-hébergement et l’intégration commerciale, tandis que les 33 millions de paramètres rendent le modèle relativement compact.

Limites et points d’attention. Les positions obtenues sur BEIR, French et European restent dans la seconde moitié de leurs classements respectifs. Les tracks German et Legal sont plus faibles, et Medical constitue le résultat le moins élevé, ce qui limite son intérêt pour les corpus spécialisés. Le traitement exclusivement anglophone réduit la pertinence pratique des résultats multilingues. La limite de 512 tokens impose aussi de découper les documents longs avant indexation. Sorti en 2023, il appartient à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique anglophone, RAG compact, similarité et clustering sur des passages courts.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).