DeepPavlov/distilrubert-small-cased-conversational
DeepPavlov/distilrubert-small-cased-conversational est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 28 juin 2022. Ses 107 millions de paramètres, tous actifs, produisent des représentations vectorielles denses de dimension 768. Son architecture comprend 2…
DeepPavlov/distilrubert-small-cased-conversational est un modèle d’embedding russe sensible à la casse, publié par DeepPavlov le 28 juin 2022. Ses 107 millions de paramètres, tous actifs, produisent des représentations vectorielles denses de dimension 768. Son architecture comprend 2 couches, une dimension cachée de 768 et 12 têtes.
Le modèle transforme des textes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Son entraînement couvre notamment des sous-titres, des contenus conversationnels et des textes issus de réseaux sociaux russophones.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | DeepPavlov |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 28 juin 2022 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 107 millions |
| Paramètres actifs | 107 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 8,4 % | 186ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 8,9 % | 160ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 15,6 % | 196ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 12,0 % | 147ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 14,9 % | 150ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 218ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,7 % | 196ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 42,1 % | 53ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 28,2 % | 114ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 24,7 % | 90ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 23,7 % | 108ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Korean | 3,8 % | 93ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le principal point fort ressort du track MTEB Russian, où le modèle obtient son meilleur résultat relatif sur des tâches de classification, de clustering, de reranking et de comparaison de paires. Son entraînement sur OpenSubtitles, Dirty, Pikabu et le segment réseaux sociaux de Taiga l’oriente vers le russe conversationnel et les contenus informels. La distillation combine des pertes KL, MLM, d’intégration cosinus et MSE appliquée aux cartes d’attention, dans une architecture limitée à 2 couches.
Limites et points d’attention. Les résultats MTEB en français, allemand et néerlandais placent le modèle près du bas des classements concernés, ce qui réduit son intérêt hors du russe. Les tracks MTEB Legal et RTEB Legal sont également faibles, notamment pour la recherche dans les décisions, lois, résumés et questions-réponses juridiques. La dimension 768 alourdit l’index vectoriel et augmente le coût de la recherche par rapport à des embeddings de dimension inférieure. Sorti il y a près de quatre ans, un âge très long à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents et peut avoir quitté les catalogues courants. Usages pertinents : recherche sémantique, clustering et récupération RAG sur des contenus russophones conversationnels ou informels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).