sentence-transformers/LaBSE
Publié par Sentence Transformers le 1er novembre 2019 sous licence ouverte Apache 2.0, sentence-transformers/LaBSE est un modèle d’embedding multilingue de 471 millions de paramètres. Il projette des textes dans 109 langues vers un espace vectoriel dense partagé de 768 dimensions.
Publié par Sentence Transformers le 1er novembre 2019 sous licence ouverte Apache 2.0, sentence-transformers/LaBSE est un modèle d’embedding multilingue de 471 millions de paramètres. Il projette des textes dans 109 langues vers un espace vectoriel dense partagé de 768 dimensions.
Ce portage PyTorch de LaBSE repose sur BertModel et s’intègre à Sentence-Transformers. Il accepte jusqu’à 256 jetons et combine pooling du jeton CLS, couche dense avec activation Tanh et normalisation. Ses vecteurs servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering multilingue.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 1 novembre 2019 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 471 millions |
| Paramètres actifs | 471 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR-NL | 19,5 % | 16ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: BEIR | 19,0 % | 177ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 21,9 % | 145ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 26,2 % | 167ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 13,8 % | 87ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 27,0 % | 87ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 28,8 % | 119ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 32,3 % | 127ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 51,8 % | 46ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 13,1 % | 154ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,6 % | 130ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 61,7 % | 23ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR-NL
MTEB: BEIR
Notre analyse
Forces. Les résultats MTEB montrent surtout un intérêt pour les traitements multilingues, avec un positionnement relativement solide sur les langues indiciennes et le coréen. L’espace partagé entre 109 langues convient à la recherche de contenus comparables entre langues, au rapprochement de phrases et au regroupement de corpus internationaux. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. La représentation normalisée facilite également les comparaisons de similarité entre vecteurs.
Limites et points d’attention. Les résultats sont moins favorables en farsi et en espagnol, où le modèle se situe près du bas des classements MTEB considérés, tandis que le français et les langues européennes occupent plutôt le milieu de tableau. Les vecteurs de 768 dimensions alourdissent l’index et le calcul de recherche par rapport à des représentations plus petites. La limite de 256 jetons impose de segmenter les documents longs. Avec environ sept ans d’ancienneté, durée très importante à l’échelle de l’IA, LaBSE appartient à une génération probablement dépassée par des embeddings multilingues plus récents. Usages pertinents : recherche sémantique, RAG et clustering de textes courts dans des corpus multilingues.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).