ai-forever/sbert_large_nlu_ru
Publié le 20 novembre 2020 par ai-forever, ai-forever/sbert_large_nlu_ru est un modèle BERT large non sensible à la casse, spécialisé dans les embeddings de phrases en russe. Ses 427 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Il est distribué sous licence…
Publié le 20 novembre 2020 par ai-forever, ai-forever/sbert_large_nlu_ru est un modèle BERT large non sensible à la casse, spécialisé dans les embeddings de phrases en russe. Ses 427 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Il est distribué sous licence ouverte MIT.
Le modèle transforme des textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Il s’intègre avec AutoTokenizer et AutoModel de Transformers, avec une moyenne des embeddings de tokens pondérée par le masque d’attention.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ai-forever |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 20 novembre 2020 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 427 millions |
| Paramètres actifs | 427 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 6,9 % | 165ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 12,6 % | 200ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 6,9 % | 158ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 11,9 % | 151ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 214ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 3,1 % | 201ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 45,7 % | 49ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 26,9 % | 115ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Dutch | 21,3 % | 113ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: German | 20,3 % | 96ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Korean | 2,3 % | 101ᵉ / 102 | mteb | ✅ Mesuré |
| MTEB: Instruction Following | 0,6 % | 49ᵉ / 196 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Russian
Notre analyse
Forces. Son principal domaine de pertinence est le russe, pour lequel son résultat MTEB est nettement supérieur à ceux obtenus en français, néerlandais ou allemand. Cette spécialisation permet d’envisager des tâches de classification, de clustering, de reranking et de comparaison de textes russophones. La licence MIT facilite l’auto-hébergement, l’intégration dans des applications et l’adaptation à des infrastructures privées. Le chargement direct avec Transformers constitue également un atout pratique pour la mise en production.
Limites et points d’attention. Son classement MTEB Russian reste en milieu de tableau, tandis que ses résultats en français, néerlandais et allemand le placent presque ou tout en bas des classements évalués. Les tracks MTEB Legal et RTEB Legal montrent aussi une faible aptitude à la recherche juridique. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec environ six ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering principalement sur des textes russes, après validation sur le corpus cible.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).