sentence-transformers/paraphrase-multilingual-mpnet-base-v2

sentence-transformers/paraphrase-multilingual-mpnet-base-v2 est un modèle d’embedding multilingue publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres, tous actifs, et produit des représentations denses de 768…

sentence-transformers/paraphrase-multilingual-mpnet-base-v2 est un modèle d’embedding multilingue publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres, tous actifs, et produit des représentations denses de 768 dimensions par pooling moyen des tokens.

Sa longueur de séquence maximale de 128 tokens le destine surtout aux phrases et aux paragraphes courts. Ses vecteurs servent à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Le modèle fonctionne avec Sentence-Transformers, Hugging Face Transformers et Text Embeddings Inference.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie1 novembre 2019
Dimension du vecteur768
Représentationdense
Paramètres278 millions
Paramètres actifs278 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR35,3 %153ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval21,7 %146ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal28,6 %153ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare30,6 %77ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance36,2 %81ᵉ / 97mteb✅ Mesuré
MTEB: Medical39,3 %78ᵉ / 158mteb✅ Mesuré
MTEB: Legal36,4 %105ᵉ / 157mteb✅ Mesuré
MTEB: European54,4 %39ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French27,2 %103ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German17,8 %125ᵉ / 209mteb✅ Mesuré
MTEB: Indic58,5 %34ᵉ / 119mteb✅ Mesuré
MTEB: Spanish58,2 %21ᵉ / 27mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

Hum-Works/lodestone-bas…37 %
▶ sentence-transformers/p…35 %

MTEB: Long-context Retrieval

▶ sentence-transformers/p…22 %
Gameselo/STS-multilingu…20 %

Notre analyse

Forces. Les résultats MTEB montrent une couverture multilingue effective, avec les positions relatives les plus favorables sur les tracks Korean, Indic, European et French. Ces évaluations couvrent notamment la classification, le clustering, la recherche, le reranking, la comparaison de paires et le bitext mining selon les langues. Cette polyvalence convient à la mise en correspondance de contenus multilingues et à l’organisation de corpus. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement dans des applications commerciales ou internes.

Limites et points d’attention. Le track Spanish place le modèle près du bas du classement, tandis que les résultats Russian restent plus modestes que ses meilleurs positionnements relatifs. Les vecteurs de 768 dimensions alourdissent davantage les index et les calculs de similarité que des représentations plus petites. La limite de 128 tokens impose aussi de découper les textes longs avant l’indexation. Sorti le 1er novembre 2019, le modèle approche sept ans, une ancienneté très importante en IA : il est probablement dépassé par des embeddings multilingues plus récents et relève d’une génération souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique multilingue sur passages courts, RAG avec segmentation, similarité de phrases et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).