sergeyzh/LaBSE-ru-turbo

Publié par sergeyzh le 27 juin 2024 sous licence ouverte MIT, sergeyzh/LaBSE-ru-turbo est un modèle BERT de 129 millions de paramètres destiné aux embeddings de phrases en russe. Fondé sur cointegrated/LaBSE-en-ru, il accepte des séquences de 512 tokens et produit des vecteurs denses de…

Publié par sergeyzh le 27 juin 2024 sous licence ouverte MIT, sergeyzh/LaBSE-ru-turbo est un modèle BERT de 129 millions de paramètres destiné aux embeddings de phrases en russe. Fondé sur cointegrated/LaBSE-en-ru, il accepte des séquences de 512 tokens et produit des vecteurs denses de 768 dimensions.

Le modèle s’intègre à SentenceTransformers et mesure la proximité entre textes par produit scalaire. Il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, au classement par similarité et au clustering. Son ancienneté d’environ deux ans le rattache toutefois à une génération désormais ancienne à l’échelle de l’IA.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursergeyzh
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie27 juin 2024
Dimension du vecteur768
Représentationdense
Paramètres129 millions
Paramètres actifs129 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR34,6 %154ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval30,6 %123ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal26,3 %166ᵉ / 208mteb✅ Mesuré
MTEB: Medical29,5 %118ᵉ / 158mteb✅ Mesuré
MTEB: Legal33,4 %122ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French13,9 %150ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German11,8 %164ᵉ / 209mteb✅ Mesuré
MTEB: Russian59,4 %29ᵉ / 104mteb✅ Mesuré
MTEB: French42,6 %93ᵉ / 117mteb✅ Mesuré
MTEB: German36,0 %72ᵉ / 96mteb✅ Mesuré
MTEB: Korean3,0 %99ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

Hum-Works/lodestone-bas…37 %
▶ sergeyzh/LaBSE-ru-turbo35 %

MTEB: Long-context Retrieval

▶ sergeyzh/LaBSE-ru-turbo31 %
consciousAI/cai-lunaris…30 %

Notre analyse

Forces. Le russe constitue son principal point fort dans MTEB, avec un classement situé dans le premier tiers sur des tâches mêlant classification, clustering, reranking et comparaison de textes. Cette spécialisation le rend plus pertinent pour organiser, rapprocher ou retrouver des contenus russophones que pour couvrir uniformément plusieurs langues. La licence MIT facilite l’auto-hébergement, l’adaptation et l’intégration dans des systèmes commerciaux. Son format de 129 millions de paramètres reste relativement contenu, tandis que les vecteurs de 768 dimensions offrent une représentation dense standard, directement exploitable dans un index vectoriel.

Limites et points d'attention. Les résultats en français et en allemand se situent dans la partie basse de leurs classements MTEB. Les performances sont également faibles sur BEIR, la recherche juridique et Long-context Retrieval, ce qui limite son intérêt pour la récupération généraliste sans adaptation, les corpus juridiques et les documents dont l’information pertinente dépasse la fenêtre de 512 tokens. Les vecteurs de 768 dimensions alourdissent aussi davantage le stockage et la recherche qu’une représentation plus compacte. Compte tenu de son âge, des modèles plus récents peuvent offrir de meilleurs compromis. Usages pertinents : recherche sémantique, RAG et clustering principalement sur des phrases ou passages russophones de longueur modérée.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).