DeepPavlov/rubert-base-cased-sentence

DeepPavlov/rubert-base-cased-sentence est un modèle d’embedding publié par DeepPavlov le 4 mars 2020. Cet encodeur sensible à la casse, fondé sur RuBERT et destiné au russe, produit des représentations denses de 768 dimensions par moyenne des embeddings de tokens, selon l’approche…

DeepPavlov/rubert-base-cased-sentence est un modèle d’embedding publié par DeepPavlov le 4 mars 2020. Cet encodeur sensible à la casse, fondé sur RuBERT et destiné au russe, produit des représentations denses de 768 dimensions par moyenne des embeddings de tokens, selon l’approche Sentence-BERT.

Référencé avec 107 millions de paramètres actifs, il convertit des phrases en vecteurs utilisables pour la recherche sémantique, la similarité, le clustering et la récupération de passages dans un système RAG. Son architecture comprend 12 couches, une dimension cachée de 768 et 12 têtes.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurDeepPavlov
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie4 mars 2020
Dimension du vecteur768
Représentationdense, avec moyenne des embeddings de tokens
Paramètres107 millions
Paramètres actifs107 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR5,3 %190ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval8,1 %162ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal11,1 %203ᵉ / 208mteb✅ Mesuré
MTEB: Medical10,1 %152ᵉ / 158mteb✅ Mesuré
MTEB: Legal15,1 %149ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,5 %205ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German2,9 %204ᵉ / 209mteb✅ Mesuré
MTEB: Russian42,2 %52ᵉ / 104mteb✅ Mesuré
MTEB: French31,7 %104ᵉ / 117mteb✅ Mesuré
MTEB: German26,3 %84ᵉ / 96mteb✅ Mesuré
MTEB: Dutch25,4 %104ᵉ / 113mteb✅ Mesuré
MTEB: Korean5,5 %90ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ DeepPavlov/rubert-base-…5 %

MTEB: Long-context Retrieval

Jaume/gemma-2b-embeddin…9 %
▶ DeepPavlov/rubert-base-…8 %
malenia1/ternary-weight…6 %

Notre analyse

Forces. Son principal point fort est le traitement sémantique du russe, langue sur laquelle il obtient son meilleur résultat relatif dans MTEB. Son affinage combine SNLI traduit en russe et la partie russe de l’ensemble de développement XNLI, ce qui l’oriente vers la comparaison de phrases. La moyenne des embeddings de tokens fournit un vecteur unique par texte, directement exploitable pour indexer, rapprocher ou regrouper des contenus russophones.

Limites et points d’attention. Les résultats MTEB sont faibles en français, en allemand et en néerlandais, ce qui limite son intérêt pour des corpus multilingues. Les évaluations MTEB Legal et RTEB Legal le placent également près du bas du classement pour la recherche juridique. La dimension de 768 alourdit l’index et augmente le coût de la recherche par rapport à des représentations plus compactes. Publié il y a environ six ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des encodeurs plus récents. Les chiffres disponibles indiquent 107 millions de paramètres, tandis que l’architecture déclarée en compte 180 millions. Usages pertinents : similarité, clustering et recherche sémantique sur des phrases russes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).