sentence-transformers/LaBSE

Publié par Sentence Transformers le 1er novembre 2019 sous licence ouverte Apache 2.0, sentence-transformers/LaBSE est un modèle d’embedding multilingue de 471 millions de paramètres. Il projette des textes dans 109 langues vers un espace vectoriel dense partagé de 768 dimensions.

Publié par Sentence Transformers le 1er novembre 2019 sous licence ouverte Apache 2.0, sentence-transformers/LaBSE est un modèle d’embedding multilingue de 471 millions de paramètres. Il projette des textes dans 109 langues vers un espace vectoriel dense partagé de 768 dimensions.

Ce portage PyTorch de LaBSE repose sur BertModel et s’intègre à Sentence-Transformers. Il accepte jusqu’à 256 jetons et combine pooling du jeton CLS, couche dense avec activation Tanh et normalisation. Ses vecteurs servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering multilingue.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie1 novembre 2019
Dimension du vecteur768
Représentationdense
Paramètres471 millions
Paramètres actifs471 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR-NL19,5 %16ᵉ / 16mteb✅ Mesuré
MTEB: BEIR19,0 %177ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval21,9 %145ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal26,2 %167ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare13,8 %87ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance27,0 %87ᵉ / 97mteb✅ Mesuré
MTEB: Medical28,8 %119ᵉ / 158mteb✅ Mesuré
MTEB: Legal32,3 %127ᵉ / 157mteb✅ Mesuré
MTEB: European51,8 %46ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French13,1 %154ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,6 %130ᵉ / 209mteb✅ Mesuré
MTEB: Indic61,7 %23ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR-NL

▶ sentence-transformers/L…19 %

MTEB: BEIR

▶ sentence-transformers/L…19 %
aari1995/German_Semanti…18 %

Notre analyse

Forces. Les résultats MTEB montrent surtout un intérêt pour les traitements multilingues, avec un positionnement relativement solide sur les langues indiciennes et le coréen. L’espace partagé entre 109 langues convient à la recherche de contenus comparables entre langues, au rapprochement de phrases et au regroupement de corpus internationaux. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La représentation normalisée facilite également les comparaisons de similarité entre vecteurs.

Limites et points d’attention. Les résultats sont moins favorables en farsi et en espagnol, où le modèle se situe près du bas des classements MTEB considérés, tandis que le français et les langues européennes occupent plutôt le milieu de tableau. Les vecteurs de 768 dimensions alourdissent l’index et le calcul de recherche par rapport à des représentations plus petites. La limite de 256 jetons impose de segmenter les documents longs. Avec environ sept ans d’ancienneté, durée très importante à l’échelle de l’IA, LaBSE appartient à une génération probablement dépassée par des embeddings multilingues plus récents. Usages pertinents : recherche sémantique, RAG et clustering de textes courts dans des corpus multilingues.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).