ai-forever/sbert_large_nlu_ru

Publié le 20 novembre 2020 par ai-forever, ai-forever/sbert_large_nlu_ru est un modèle BERT large non sensible à la casse, spécialisé dans les embeddings de phrases en russe. Ses 427 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Il est distribué sous licence…

Publié le 20 novembre 2020 par ai-forever, ai-forever/sbert_large_nlu_ru est un modèle BERT large non sensible à la casse, spécialisé dans les embeddings de phrases en russe. Ses 427 millions de paramètres produisent des vecteurs denses de 1 024 dimensions. Il est distribué sous licence ouverte MIT.

Le modèle transforme des textes en représentations numériques destinées à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Il s’intègre avec AutoTokenizer et AutoModel de Transformers, avec une moyenne des embeddings de tokens pondérée par le masque d’attention.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurai-forever
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie20 novembre 2020
Dimension du vecteur1 024
Représentationdense
Paramètres427 millions
Paramètres actifs427 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: Long-context Retrieval6,9 %165ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal12,6 %200ᵉ / 208mteb✅ Mesuré
MTEB: Medical6,9 %158ᵉ / 158mteb✅ Mesuré
MTEB: Legal11,9 %151ᵉ / 157mteb✅ Mesuré
MTEB: RTEB French0,1 %214ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German3,1 %201ᵉ / 209mteb✅ Mesuré
MTEB: Russian45,7 %49ᵉ / 104mteb✅ Mesuré
MTEB: French26,9 %115ᵉ / 117mteb✅ Mesuré
MTEB: Dutch21,3 %113ᵉ / 113mteb✅ Mesuré
MTEB: German20,3 %96ᵉ / 96mteb✅ Mesuré
MTEB: Korean2,3 %101ᵉ / 102mteb✅ Mesuré
MTEB: Instruction Following0,6 %49ᵉ / 196mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: Long-context Retrieval

Jaume/gemma-2b-embeddin…9 %
▶ ai-forever/sbert_large_…7 %
malenia1/ternary-weight…6 %

MTEB: Russian

▶ ai-forever/sbert_large_…46 %

Notre analyse

Forces. Son principal domaine de pertinence est le russe, pour lequel son résultat MTEB est nettement supérieur à ceux obtenus en français, néerlandais ou allemand. Cette spécialisation permet d’envisager des tâches de classification, de clustering, de reranking et de comparaison de textes russophones. La licence MIT facilite l’auto-hébergement, l’intégration dans des applications et l’adaptation à des infrastructures privées. Le chargement direct avec Transformers constitue également un atout pratique pour la mise en production.

Limites et points d’attention. Son classement MTEB Russian reste en milieu de tableau, tandis que ses résultats en français, néerlandais et allemand le placent presque ou tout en bas des classements évalués. Les tracks MTEB Legal et RTEB Legal montrent aussi une faible aptitude à la recherche juridique. Les vecteurs de 1 024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec environ six ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering principalement sur des textes russes, après validation sur le corpus cible.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).