sentence-transformers/static-similarity-mrl-multilingual-v1
Publié par Sentence Transformers le 15 janvier 2025 sous licence ouverte Apache 2.0, sentence-transformers/static-similarity-mrl-multilingual-v1 est un modèle d’embedding multilingue de 108 millions de paramètres. Il produit des représentations denses de 1 024 dimensions à partir d’un…
Publié par Sentence Transformers le 15 janvier 2025 sous licence ouverte Apache 2.0, sentence-transformers/static-similarity-mrl-multilingual-v1 est un modèle d’embedding multilingue de 108 millions de paramètres. Il produit des représentations denses de 1 024 dimensions à partir d’un tokenizer BERT Multilingual uncased et d’un StaticEmbedding fondé sur une moyenne EmbeddingBag.
Le modèle transforme phrases et paragraphes en vecteurs comparables par similarité cosinus. Il cible notamment la recherche sémantique, l’indexation pour le RAG, la détection de paraphrases, la classification et le clustering. Son entraînement Matryoshka autorise aussi la troncature des vecteurs avec truncate_dim.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 15 janvier 2025 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 108 millions |
| Paramètres actifs | 108 millions |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 28,3 % | 162ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 21,7 % | 14ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 60,4 % | 33ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 6,2 % | 29ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB English | 22,7 % | 4ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: RTEB Code | 16,7 % | 5ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 30,8 % | 48ᵉ / 49 | mteb | ✅ Mesuré |
| MTEB: Code | 32,2 % | 42ᵉ / 43 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 33,7 % | 109ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 17,5 % | 83ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 29,8 % | 83ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 32,1 % | 109ᵉ / 158 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Le meilleur résultat relatif apparaît sur MTEB Long-context Retrieval, où le modèle se place dans le premier quart du classement. Ce profil le rend surtout intéressant pour retrouver des passages pertinents dans des contenus étendus. Sa couverture multilingue comprend notamment l’anglais, le français, l’allemand, l’espagnol et le chinois, tandis que le track European le situe dans une zone intermédiaire. La licence Apache 2.0 facilite l’auto-hébergement, l’adaptation et l’intégration dans des infrastructures de recherche ou de RAG. La troncature Matryoshka permet d’ajuster la dimension des embeddings afin de réduire l’empreinte d’un index.
Limites et points d’attention. Les résultats sont faibles sur MTEB Chemical, avec la dernière place, ainsi qu’en polonais et en espagnol. Le français se situe dans la partie basse du classement, ce qui invite à valider la qualité sur les corpus visés. Les vecteurs complets de 1 024 dimensions alourdissent le stockage et le calcul de similarité, sauf à exploiter leur troncature. Sorti il y a environ un an, un âge déjà long dans ce secteur, le modèle peut être dépassé par des embeddings multilingues plus récents. Usages pertinents : recherche sémantique multilingue, RAG sur documents étendus, paraphrase mining et clustering, après évaluation dans la langue et le domaine ciblés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).