ai-forever/sbert_large_mt_nlu_ru
Publié par ai-forever le 18 mai 2021, ai-forever/sbert_large_mt_nlu_ru est un modèle d’embedding BERT large multitâche, sensible à la casse et spécialisé dans les phrases en russe. Ses 427 millions de paramètres produisent une représentation dense de 1 024 dimensions.
Publié par ai-forever le 18 mai 2021, ai-forever/sbert_large_mt_nlu_ru est un modèle d’embedding BERT large multitâche, sensible à la casse et spécialisé dans les phrases en russe. Ses 427 millions de paramètres produisent une représentation dense de 1 024 dimensions.
Le modèle transforme les textes en vecteurs exploitables pour la recherche sémantique, la récupération de passages dans un système RAG, la mesure de similarité et le clustering. Il calcule d’abord des embeddings de tokens avec AutoModel, puis forme l’embedding de phrase par pooling moyen tenant compte du masque d’attention.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ai-forever |
| Poids | 🟢 Poids ouverts |
| Licence | not specified |
| Date de sortie | 18 mai 2021 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 427 millions |
| Paramètres actifs | 427 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Long-context Retrieval | 6,5 % | 166ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 10,4 % | 205ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 7,5 % | 157ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 10,6 % | 155ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 0,1 % | 211ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 2,6 % | 206ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Russian | 49,1 % | 45ᵉ / 104 | mteb | ✅ Mesuré |
| MTEB: French | 26,2 % | 116ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 21,8 % | 95ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 21,5 % | 112ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Long-context Retrieval
MTEB: Russian
Notre analyse
Forces. Le russe constitue clairement son terrain le plus favorable dans MTEB. Ses résultats y sont nettement supérieurs à ceux obtenus en français, en allemand, en néerlandais ou dans le domaine juridique. Cette orientation le rend principalement pertinent pour la classification, le clustering, le reranking et la comparaison de textes russes. La représentation dense de 1 024 dimensions offre un espace vectoriel détaillé pour indexer des phrases, au prix d’une empreinte plus importante.
Limites et points d’attention. Les évaluations MTEB placent le modèle presque en fin de classement en français, en allemand et en néerlandais, ce qui limite son intérêt pour ces langues. Les tracks MTEB Legal et RTEB Legal révèlent également de très faibles performances en recherche juridique. La dimension de 1 024 alourdit les index et peut rendre la recherche plus coûteuse que pour des embeddings plus compacts. Sorti en 2021, le modèle est très ancien à l’échelle de l’IA et probablement dépassé par des solutions plus récentes, les modèles de cette période étant souvent retirés des catalogues. Usages pertinents : recherche sémantique, RAG, similarité et clustering centrés sur des contenus russes, après validation sur le corpus visé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).