cointegrated/rubert-tiny
Publié par cointegrated le 24 mai 2021 sous licence ouverte MIT, cointegrated/rubert-tiny est un modèle d’embedding dense de 12 millions de paramètres. Cette version distillée de bert-base-multilingual-cased produit des vecteurs [CLS] de 312 dimensions et cible principalement les textes…
Publié par cointegrated le 24 mai 2021 sous licence ouverte MIT, cointegrated/rubert-tiny est un modèle d’embedding dense de 12 millions de paramètres. Cette version distillée de bert-base-multilingual-cased produit des vecteurs [CLS] de 312 dimensions et cible principalement les textes russes et anglais.
Le modèle transforme les textes en représentations numériques alignées entre ces deux langues, utilisables pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement combine perte MLM distillée, classement de traductions et distillation des embeddings [CLS].
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cointegrated |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 24 mai 2021 |
| Dimension du vecteur | 312 |
| Représentation | dense ([CLS]) |
| Paramètres | 12 millions |
| Paramètres actifs | 12 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 8,4 % | 188ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 7,6 % | 164ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 16,9 % | 194ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 9,9 % | 153ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 20,0 % | 145ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 210ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 5,1 % | 191ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 35,2 % | 56ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 31,3 % | 105ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 27,1 % | 83ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 25,7 % | 103ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Korean | 3,5 % | 96ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le russe constitue son meilleur domaine parmi les évaluations MTEB disponibles, même si son classement reste éloigné des premières places. L’alignement des représentations russes et anglaises favorise les tâches bilingues de similarité et de rapprochement de contenus. Avec 12 millions de paramètres et des vecteurs de 312 dimensions, cointegrated/rubert-tiny permet de constituer des index relativement compacts et de limiter le volume de calcul lors de la recherche. Sa licence MIT autorise l’auto-hébergement et l’adaptation, notamment pour des tâches russes simples comme la reconnaissance d’entités nommées ou la classification de sentiments.
Limites et points d'attention. Les résultats MTEB en français, allemand et néerlandais se situent dans le bas des classements, ce qui limite son intérêt comme moteur d’embedding multilingue généraliste. Les évaluations MTEB Legal et RTEB Legal sont également faibles, rendant le modèle peu adapté à la recherche juridique exigeante. Sorti il y a près de cinq ans, il appartient à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé par des modèles plus récents. Usages pertinents : prototypes légers en russe ou en anglais, recherche bilingue simple, clustering et index sémantiques à faible empreinte.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).