DeepPavlov/rubert-base-cased-sentence
DeepPavlov/rubert-base-cased-sentence est un modèle d’embedding publié par DeepPavlov le 4 mars 2020. Cet encodeur sensible à la casse, fondé sur RuBERT et destiné au russe, produit des représentations denses de 768 dimensions par moyenne des embeddings de tokens, selon l’approche…
DeepPavlov/rubert-base-cased-sentence est un modèle d’embedding publié par DeepPavlov le 4 mars 2020. Cet encodeur sensible à la casse, fondé sur RuBERT et destiné au russe, produit des représentations denses de 768 dimensions par moyenne des embeddings de tokens, selon l’approche Sentence-BERT.
Référencé avec 107 millions de paramètres actifs, il convertit des phrases en vecteurs utilisables pour la recherche sémantique, la similarité, le clustering et la récupération de passages dans un système RAG. Son architecture comprend 12 couches, une dimension cachée de 768 et 12 têtes.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | DeepPavlov |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 4 mars 2020 |
| Dimension du vecteur | 768 |
| Représentation | dense, avec moyenne des embeddings de tokens |
| Paramètres | 107 millions |
| Paramètres actifs | 107 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 5,3 % | 190ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 8,1 % | 162ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 11,1 % | 203ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 10,1 % | 152ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 15,1 % | 149ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,5 % | 205ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 2,9 % | 204ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 42,2 % | 52ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 31,7 % | 104ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 26,3 % | 84ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 25,4 % | 104ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Korean | 5,5 % | 90ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son principal point fort est le traitement sémantique du russe, langue sur laquelle il obtient son meilleur résultat relatif dans MTEB. Son affinage combine SNLI traduit en russe et la partie russe de l’ensemble de développement XNLI, ce qui l’oriente vers la comparaison de phrases. La moyenne des embeddings de tokens fournit un vecteur unique par texte, directement exploitable pour indexer, rapprocher ou regrouper des contenus russophones.
Limites et points d’attention. Les résultats MTEB sont faibles en français, en allemand et en néerlandais, ce qui limite son intérêt pour des corpus multilingues. Les évaluations MTEB Legal et RTEB Legal le placent également près du bas du classement pour la recherche juridique. La dimension de 768 alourdit l’index et augmente le coût de la recherche par rapport à des représentations plus compactes. Publié il y a environ six ans, il appartient à une génération ancienne à l’échelle de l’IA et est probablement dépassé par des encodeurs plus récents. Les chiffres disponibles indiquent 107 millions de paramètres, tandis que l’architecture déclarée en compte 180 millions. Usages pertinents : similarité, clustering et recherche sémantique sur des phrases russes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).