cointegrated/rubert-tiny2

Publié par cointegrated le 28 octobre 2021, cointegrated/rubert-tiny2 est un petit encodeur BERT de 29 millions de paramètres, conçu uniquement pour le russe. Il produit des embeddings denses de 312 dimensions à partir du token CLS normalisé et accepte des séquences allant jusqu’à 2 048…

Publié par cointegrated le 28 octobre 2021, cointegrated/rubert-tiny2 est un petit encodeur BERT de 29 millions de paramètres, conçu uniquement pour le russe. Il produit des embeddings denses de 312 dimensions à partir du token CLS normalisé et accepte des séquences allant jusqu’à 2 048 tokens.

Distribué sous licence ouverte MIT, le modèle peut être auto-hébergé avec Transformers ou Sentence Transformers. Ses vecteurs servent à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité, au clustering et à la classification KNN de textes courts. Un affinage reste possible pour une tâche en aval.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurcointegrated
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie28 octobre 2021
Dimension du vecteur312
Représentationdense (embedding de phrase à partir du token CLS normalisé)
Paramètres29 millions
Paramètres actifs29 millions
Longueur de séquence max2 048 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR10,6 %183ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval14,1 %156ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal17,0 %193ᵉ / 208mteb✅ Mesuré
MTEB: Medical11,4 %148ᵉ / 158mteb✅ Mesuré
MTEB: Legal22,4 %143ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,4 %207ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German4,1 %195ᵉ / 209mteb✅ Mesuré
MTEB: Russian42,7 %50ᵉ / 104mteb✅ Mesuré
MTEB: French29,0 %111ᵉ / 117mteb✅ Mesuré
MTEB: Dutch24,8 %107ᵉ / 113mteb✅ Mesuré
MTEB: German24,4 %91ᵉ / 96mteb✅ Mesuré
MTEB: Korean3,6 %95ᵉ / 102mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ cointegrated/rubert-tin…11 %
silma-ai/silma-embedddi…9 %

MTEB: Long-context Retrieval

aari1995/German_Semanti…18 %
▶ cointegrated/rubert-tin…14 %
silma-ai/silma-embedddi…14 %

Notre analyse

Forces. Son meilleur résultat MTEB concerne le russe, avec une qualité évaluée sur des tâches de classification, clustering, reranking et appariement. Ses embeddings de segments ont été ajustés sur une tâche NLI, ce qui soutient la représentation de phrases. La longueur maximale de 2 048 tokens facilite aussi le traitement de documents relativement longs. Avec 312 dimensions et 29 millions de paramètres actifs, cointegrated/rubert-tiny2 permet de constituer des index vectoriels plus compacts que des encodeurs produisant de grands vecteurs. La licence MIT favorise l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d'attention. Le modèle est destiné uniquement au russe, ce que confirment ses résultats nettement plus faibles et ses rangs proches du bas des classements MTEB en français, néerlandais et allemand. Les évaluations MTEB Legal et RTEB Legal le placent également parmi les solutions les moins performantes pour la recherche dans des corpus juridiques. Sorti en 2021, il a environ cinq ans, une ancienneté très longue à l’échelle de l’IA, et apparaît probablement dépassé face à des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique, clustering ou classification légère de contenus russes, lorsque la compacité et l’auto-hébergement priment sur la performance multilingue ou juridique.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).