cointegrated/rubert-tiny

Publié par cointegrated le 24 mai 2021 sous licence ouverte MIT, cointegrated/rubert-tiny est un modèle d’embedding dense de 12 millions de paramètres. Cette version distillée de bert-base-multilingual-cased produit des vecteurs [CLS] de 312 dimensions et cible principalement les textes…

Publié par cointegrated le 24 mai 2021 sous licence ouverte MIT, cointegrated/rubert-tiny est un modèle d’embedding dense de 12 millions de paramètres. Cette version distillée de bert-base-multilingual-cased produit des vecteurs [CLS] de 312 dimensions et cible principalement les textes russes et anglais.

Le modèle transforme les textes en représentations numériques alignées entre ces deux langues, utilisables pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Son entraînement combine perte MLM distillée, classement de traductions et distillation des embeddings [CLS].

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcointegrated
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie24 mai 2021
Dimension du vecteur312
Représentationdense ([CLS])
Paramètres12 millions
Paramètres actifs12 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR8,4 %188ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval7,6 %164ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal16,9 %194ᵉ / 208mteb✅ Mesuré
MTEB: Medical9,9 %153ᵉ / 158mteb✅ Mesuré
MTEB: Legal20,0 %145ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,1 %210ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German5,1 %191ᵉ / 209mteb✅ Mesuré
MTEB: Russian35,2 %56ᵉ / 104mteb✅ Mesuré
MTEB: French31,3 %105ᵉ / 117mteb✅ Mesuré
MTEB: German27,1 %83ᵉ / 96mteb✅ Mesuré
MTEB: Dutch25,7 %103ᵉ / 113mteb✅ Mesuré
MTEB: Korean3,5 %96ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ cointegrated/rubert-tiny8 %

MTEB: Long-context Retrieval

Jaume/gemma-2b-embeddin…9 %
▶ cointegrated/rubert-tiny8 %
malenia1/ternary-weight…6 %

Notre analyse

Forces. Le russe constitue son meilleur domaine parmi les évaluations MTEB disponibles, même si son classement reste éloigné des premières places. L’alignement des représentations russes et anglaises favorise les tâches bilingues de similarité et de rapprochement de contenus. Avec 12 millions de paramètres et des vecteurs de 312 dimensions, cointegrated/rubert-tiny permet de constituer des index relativement compacts et de limiter le volume de calcul lors de la recherche. Sa licence MIT autorise l’auto-hébergement et l’adaptation, notamment pour des tâches russes simples comme la reconnaissance d’entités nommées ou la classification de sentiments.

Limites et points d'attention. Les résultats MTEB en français, allemand et néerlandais se situent dans le bas des classements, ce qui limite son intérêt comme moteur d’embedding multilingue généraliste. Les évaluations MTEB Legal et RTEB Legal sont également faibles, rendant le modèle peu adapté à la recherche juridique exigeante. Sorti il y a près de cinq ans, il appartient à une génération ancienne à l’échelle de l’IA et apparaît probablement dépassé par des modèles plus récents. Usages pertinents : prototypes légers en russe ou en anglais, recherche bilingue simple, clustering et index sémantiques à faible empreinte.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).