sergeyzh/rubert-tiny-turbo
Publié par sergeyzh le 21 juin 2024 sous licence ouverte MIT, sergeyzh/rubert-tiny-turbo est un modèle BERT dense de 29 millions de paramètres, fondé sur cointegrated/rubert-tiny2. Principalement destiné au russe, il accepte des séquences atteignant 2 048 tokens et produit des vecteurs…
Publié par sergeyzh le 21 juin 2024 sous licence ouverte MIT, sergeyzh/rubert-tiny-turbo est un modèle BERT dense de 29 millions de paramètres, fondé sur cointegrated/rubert-tiny2. Principalement destiné au russe, il accepte des séquences atteignant 2 048 tokens et produit des vecteurs de 312 dimensions.
Le modèle calcule des embeddings de phrases pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Il s’intègre à SentenceTransformers au moyen de la méthode encode.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sergeyzh |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 21 juin 2024 |
| Dimension du vecteur | 312 |
| Représentation | dense |
| Paramètres | 29 millions |
| Paramètres actifs | 29 millions |
| Longueur de séquence max | 2 048 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 17,6 % | 179ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 27,4 % | 134ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 17,4 % | 191ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 18,6 % | 142ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 23,0 % | 142ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 2,3 % | 191ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,1 % | 200ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 53,8 % | 38ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 30,4 % | 107ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 27,2 % | 101ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 26,2 % | 85ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 4,0 % | 91ᵉ / 102 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le russe constitue son meilleur terrain relatif dans MTEB, sur un ensemble couvrant notamment la classification, le clustering et le reranking. La fenêtre de 2 048 tokens permet de traiter des textes relativement longs en une séquence. Les vecteurs compacts de 312 dimensions réduisent la taille des index par rapport à des représentations plus larges, tandis que les 29 millions de paramètres facilitent un déploiement léger. La licence MIT autorise l’auto-hébergement et une réutilisation peu restrictive.
Limites et points d'attention. Les résultats MTEB sont nettement plus faibles en français, néerlandais et allemand, ce qui limite son intérêt hors du russe. Le track Long-context Retrieval reste faible malgré la longueur de séquence acceptée, et le juridique figure également parmi ses domaines les moins convaincants. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2024 est probablement dépassé par des embeddings plus récents, tandis que de nombreux modèles de sa période ont quitté les catalogues actifs. Usages pertinents : index compacts de textes russes, recherche sémantique, clustering et récupération de passages pour un RAG auto-hébergé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).