DeepPavlov/rubert-base-cased
DeepPavlov/rubert-base-cased est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 4 mars 2020. Le décompte fourni atteint 1 milliard de paramètres, tous actifs, et produit des représentations denses de 768 dimensions. Son architecture repose sur BERT, avec 12…
DeepPavlov/rubert-base-cased est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 4 mars 2020. Le décompte fourni atteint 1 milliard de paramètres, tous actifs, et produit des représentations denses de 768 dimensions. Son architecture repose sur BERT, avec 12 couches, 12 têtes et une dimension cachée de 768.
Entraîné sur Wikipédia en russe et des données d’actualité, il utilise un vocabulaire de sous-tokens russes et une initialisation issue de BERT-base multilingue. Ses vecteurs peuvent alimenter la recherche sémantique, la récupération documentaire d’un système RAG, la mesure de similarité et le clustering.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | DeepPavlov |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 4 mars 2020 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 1 milliards |
| Paramètres actifs | 1 milliards |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 4,6 % | 191ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 8,1 % | 163ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 10,5 % | 204ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 9,8 % | 154ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 11,7 % | 153ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 216ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,6 % | 197ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 37,7 % | 55ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 29,0 % | 112ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 24,9 % | 89ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 6,1 % | 88ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,8 % | 40ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat relatif de DeepPavlov/rubert-base-cased apparaît sur MTEB Russian, où il se situe en milieu de classement. Cette orientation correspond à son corpus d’entraînement russe et à son vocabulaire spécialisé. La représentation dense de 768 dimensions constitue un format courant pour indexer des textes et calculer leur proximité. Les têtes MLM et NSP héritées de BERT complètent une architecture conçue pour représenter le contexte linguistique.
Limites et points d’attention. Les évaluations MTEB French et German placent le modèle près du bas de leurs classements respectifs. Les résultats sont encore plus faibles sur MTEB Legal, RTEB Legal et MTEB Medical, ce qui limite son intérêt pour la récupération juridique ou médicale. Sa sortie de 768 dimensions implique aussi un stockage d’index et des calculs de similarité plus lourds que ceux de représentations moins dimensionnées. Vieux d’environ six ans, il appartient à une génération ancienne de modèles d’embedding et apparaît probablement dépassé par des solutions plus récentes. Enfin, une incohérence doit être relevée entre le décompte fourni de 1 milliard de paramètres et la configuration architecturale annoncée à 180 millions. Usages pertinents : recherche sémantique, similarité et clustering sur des corpus russes généralistes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).