cointegrated/LaBSE-en-ru

Publié par cointegrated le 10 juin 2021, cointegrated/LaBSE-en-ru est un modèle d’embedding dense de 129 millions de paramètres. Cette version allégée de sentence-transformers/LaBSE, dérivée du LaBSE de Google, conserve les tokens anglais et russes. Chaque texte est représenté par un…

Publié par cointegrated le 10 juin 2021, cointegrated/LaBSE-en-ru est un modèle d’embedding dense de 129 millions de paramètres. Cette version allégée de sentence-transformers/LaBSE, dérivée du LaBSE de Google, conserve les tokens anglais et russes. Chaque texte est représenté par un vecteur normalisé de 768 dimensions, obtenu à partir de la sortie pooler_output.

Le modèle sert à mesurer la proximité sémantique entre des phrases, à rechercher des passages dans un corpus bilingue, à alimenter la phase de récupération d’un système RAG ou à regrouper des contenus similaires. Il produit des vecteurs et ne génère pas de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcointegrated
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie10 juin 2021
Dimension du vecteur768
Représentationdense
Paramètres129 millions
Paramètres actifs129 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR17,3 %180ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval24,1 %142ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal25,9 %169ᵉ / 208mteb✅ Mesuré
MTEB: Medical22,0 %137ᵉ / 158mteb✅ Mesuré
MTEB: Legal30,1 %134ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French6,9 %165ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German12,8 %159ᵉ / 209mteb✅ Mesuré
MTEB: Russian48,6 %48ᵉ / 104mteb✅ Mesuré
MTEB: French41,0 %97ᵉ / 117mteb✅ Mesuré
MTEB: German34,7 %77ᵉ / 96mteb✅ Mesuré
MTEB: Korean3,5 %97ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

aari1995/German_Semanti…18 %
▶ cointegrated/LaBSE-en-ru17 %
omarelshehy/arabic-engl…16 %

MTEB: Long-context Retrieval

▶ cointegrated/LaBSE-en-ru24 %

Notre analyse

Forces. Le meilleur résultat relatif apparaît sur MTEB Russian, ce qui correspond à la spécialisation du vocabulaire en russe et en anglais. Le modèle reste adapté à la représentation dense de phrases bilingues et à leur comparaison dans un même espace vectoriel. La normalisation des embeddings facilite l’emploi de mesures de similarité, notamment pour la recherche sémantique, le rapprochement de phrases et le clustering. Avec 129 millions de paramètres et des vecteurs de 768 dimensions, il présente un format maîtrisable pour un déploiement spécialisé.

Limites et points d’attention. Les résultats MTEB French et German se situent dans la partie basse de leurs classements respectifs, en cohérence avec un vocabulaire limité à l’anglais et au russe. Les performances sont également faibles sur MTEB Legal, RTEB Legal et Long-context Retrieval, ce qui réduit son intérêt pour les corpus juridiques et la récupération dans des documents longs. Sorti en 2021, il est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, similarité et clustering de phrases principalement russes ou anglaises, sur des corpus ne demandant ni spécialisation juridique ni traitement avancé du contexte long.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).