DeepPavlov/rubert-base-cased

DeepPavlov/rubert-base-cased est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 4 mars 2020. Le décompte fourni atteint 1 milliard de paramètres, tous actifs, et produit des représentations denses de 768 dimensions. Son architecture repose sur BERT, avec 12…

DeepPavlov/rubert-base-cased est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 4 mars 2020. Le décompte fourni atteint 1 milliard de paramètres, tous actifs, et produit des représentations denses de 768 dimensions. Son architecture repose sur BERT, avec 12 couches, 12 têtes et une dimension cachée de 768.

Entraîné sur Wikipédia en russe et des données d’actualité, il utilise un vocabulaire de sous-tokens russes et une initialisation issue de BERT-base multilingue. Ses vecteurs peuvent alimenter la recherche sémantique, la récupération documentaire d’un système RAG, la mesure de similarité et le clustering.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurDeepPavlov
Poids🟢 Poids ouverts
Licencenot specified
Date de sortie4 mars 2020
Dimension du vecteur768
Représentationdense
Paramètres1 milliards
Paramètres actifs1 milliards
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR4,6 %191ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval8,1 %163ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal10,5 %204ᵉ / 208mteb✅ Mesuré
MTEB: Medical9,8 %154ᵉ / 158mteb✅ Mesuré
MTEB: Legal11,7 %153ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,1 %216ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German3,6 %197ᵉ / 209mteb✅ Mesuré
MTEB: Russian37,7 %55ᵉ / 104mteb✅ Mesuré
MTEB: French29,0 %112ᵉ / 117mteb✅ Mesuré
MTEB: German24,9 %89ᵉ / 96mteb✅ Mesuré
MTEB: Korean6,1 %88ᵉ / 102mteb✅ Mesuré
MTEB: Instruction Following0,8 %40ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ DeepPavlov/rubert-base-…5 %

MTEB: Long-context Retrieval

Jaume/gemma-2b-embeddin…9 %
▶ DeepPavlov/rubert-base-…8 %
malenia1/ternary-weight…6 %

Notre analyse

Forces. Le meilleur résultat relatif de DeepPavlov/rubert-base-cased apparaît sur MTEB Russian, où il se situe en milieu de classement. Cette orientation correspond à son corpus d’entraînement russe et à son vocabulaire spécialisé. La représentation dense de 768 dimensions constitue un format courant pour indexer des textes et calculer leur proximité. Les têtes MLM et NSP héritées de BERT complètent une architecture conçue pour représenter le contexte linguistique.

Limites et points d’attention. Les évaluations MTEB French et German placent le modèle près du bas de leurs classements respectifs. Les résultats sont encore plus faibles sur MTEB Legal, RTEB Legal et MTEB Medical, ce qui limite son intérêt pour la récupération juridique ou médicale. Sa sortie de 768 dimensions implique aussi un stockage d’index et des calculs de similarité plus lourds que ceux de représentations moins dimensionnées. Vieux d’environ six ans, il appartient à une génération ancienne de modèles d’embedding et apparaît probablement dépassé par des solutions plus récentes. Enfin, une incohérence doit être relevée entre le décompte fourni de 1 milliard de paramètres et la configuration architecturale annoncée à 180 millions. Usages pertinents : recherche sémantique, similarité et clustering sur des corpus russes généralistes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).