thenlper/gte-small
thenlper/gte-small est un modèle d’embedding dense publié par Alibaba le 27 juillet 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 33 millions de paramètres, tous actifs, et convertit les textes en vecteurs de 384 dimensions. Il accepte jusqu’à 512 tokens et…
thenlper/gte-small est un modèle d’embedding dense publié par Alibaba le 27 juillet 2023 sous licence ouverte MIT. Fondé principalement sur BERT, il compte 33 millions de paramètres, tous actifs, et convertit les textes en vecteurs de 384 dimensions. Il accepte jusqu’à 512 tokens et traite exclusivement l’anglais.
Entraîné par apprentissage contrastif multi-étapes sur des paires de textes issues de domaines variés, il applique un pooling moyen des états cachés, avec normalisation L2 optionnelle. Il sert à la recherche sémantique, au RAG, à la similarité, au clustering et au reranking, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Alibaba |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 27 juillet 2023 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,5 % | 104ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,5 % | 102ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 31,0 % | 135ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,5 % | 87ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,9 % | 79ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,7 % | 81ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 18,5 % | 134ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 14,7 % | 147ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 49,1 % | 66ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 40,1 % | 54ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,5 % | 104ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Russian | 26,2 % | 76ᵉ / 104 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent BEIR et le track French, ce qui met surtout en avant la recherche d’information et, dans une moindre mesure, des tâches de classification, de clustering et de comparaison de paires. Le track European reste proche de ces résultats, malgré une conception limitée à l’anglais. Ses 384 dimensions permettent des index vectoriels plus légers qu’avec des représentations de grande dimension. La licence MIT facilite l’auto-hébergement et l’intégration commerciale, tandis que les 33 millions de paramètres rendent le modèle relativement compact.
Limites et points d’attention. Les positions obtenues sur BEIR, French et European restent dans la seconde moitié de leurs classements respectifs. Les tracks German et Legal sont plus faibles, et Medical constitue le résultat le moins élevé, ce qui limite son intérêt pour les corpus spécialisés. Le traitement exclusivement anglophone réduit la pertinence pratique des résultats multilingues. La limite de 512 tokens impose aussi de découper les documents longs avant indexation. Sorti en 2023, il appartient à une génération ancienne à l’échelle de l’IA et se trouve probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique anglophone, RAG compact, similarité et clustering sur des passages courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).