cointegrated/rubert-tiny2
Publié par cointegrated le 28 octobre 2021, cointegrated/rubert-tiny2 est un petit encodeur BERT de 29 millions de paramètres, conçu uniquement pour le russe. Il produit des embeddings denses de 312 dimensions à partir du token CLS normalisé et accepte des séquences allant jusqu’à 2 048…
Publié par cointegrated le 28 octobre 2021, cointegrated/rubert-tiny2 est un petit encodeur BERT de 29 millions de paramètres, conçu uniquement pour le russe. Il produit des embeddings denses de 312 dimensions à partir du token CLS normalisé et accepte des séquences allant jusqu’à 2 048 tokens.
Distribué sous licence ouverte MIT, le modèle peut être auto-hébergé avec Transformers ou Sentence Transformers. Ses vecteurs servent à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité, au clustering et à la classification KNN de textes courts. Un affinage reste possible pour une tâche en aval.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | cointegrated |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 28 octobre 2021 |
| Dimension du vecteur | 312 |
| Représentation | dense (embedding de phrase à partir du token CLS normalisé) |
| Paramètres | 29 millions |
| Paramètres actifs | 29 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 10,6 % | 183ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 14,1 % | 156ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 17,0 % | 193ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 11,4 % | 148ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 22,4 % | 143ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,4 % | 207ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 4,1 % | 195ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 42,7 % | 50ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 29,0 % | 111ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 24,8 % | 107ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 24,4 % | 91ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 3,6 % | 95ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Son meilleur résultat MTEB concerne le russe, avec une qualité évaluée sur des tâches de classification, clustering, reranking et appariement. Ses embeddings de segments ont été ajustés sur une tâche NLI, ce qui soutient la représentation de phrases. La longueur maximale de 2 048 tokens facilite aussi le traitement de documents relativement longs. Avec 312 dimensions et 29 millions de paramètres actifs, cointegrated/rubert-tiny2 permet de constituer des index vectoriels plus compacts que des encodeurs produisant de grands vecteurs. La licence MIT favorise l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d'attention. Le modèle est destiné uniquement au russe, ce que confirment ses résultats nettement plus faibles et ses rangs proches du bas des classements MTEB en français, néerlandais et allemand. Les évaluations MTEB Legal et RTEB Legal le placent également parmi les solutions les moins performantes pour la recherche dans des corpus juridiques. Sorti en 2021, il a environ cinq ans, une ancienneté très longue à l’échelle de l’IA, et apparaît probablement dépassé face à des embeddings plus récents de sa catégorie. Usages pertinents : recherche sémantique, clustering ou classification légère de contenus russes, lorsque la compacité et l’auto-hébergement priment sur la performance multilingue ou juridique.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).