sentence-transformers/paraphrase-multilingual-mpnet-base-v2
sentence-transformers/paraphrase-multilingual-mpnet-base-v2 est un modèle d’embedding multilingue publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres, tous actifs, et produit des représentations denses de 768…
sentence-transformers/paraphrase-multilingual-mpnet-base-v2 est un modèle d’embedding multilingue publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur XLM-RoBERTa, il compte 278 millions de paramètres, tous actifs, et produit des représentations denses de 768 dimensions par pooling moyen des tokens.
Sa longueur de séquence maximale de 128 tokens le destine surtout aux phrases et aux paragraphes courts. Ses vecteurs servent à la recherche sémantique, à l’indexation pour le RAG, au calcul de similarité et au clustering. Le modèle fonctionne avec Sentence-Transformers, Hugging Face Transformers et Text Embeddings Inference.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 1 novembre 2019 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 278 millions |
| Paramètres actifs | 278 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 35,3 % | 153ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 21,7 % | 146ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,6 % | 153ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 30,6 % | 77ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 36,2 % | 81ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,3 % | 78ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 36,4 % | 105ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 54,4 % | 39ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 27,2 % | 103ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 17,8 % | 125ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Indic | 58,5 % | 34ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Spanish | 58,2 % | 21ᵉ / 27 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB montrent une couverture multilingue effective, avec les positions relatives les plus favorables sur les tracks Korean, Indic, European et French. Ces évaluations couvrent notamment la classification, le clustering, la recherche, le reranking, la comparaison de paires et le bitext mining selon les langues. Cette polyvalence convient à la mise en correspondance de contenus multilingues et à l’organisation de corpus. La licence Apache 2.0 facilite l’intégration, la modification et l’auto-hébergement dans des applications commerciales ou internes.
Limites et points d’attention. Le track Spanish place le modèle près du bas du classement, tandis que les résultats Russian restent plus modestes que ses meilleurs positionnements relatifs. Les vecteurs de 768 dimensions alourdissent davantage les index et les calculs de similarité que des représentations plus petites. La limite de 128 tokens impose aussi de découper les textes longs avant l’indexation. Sorti le 1er novembre 2019, le modèle approche sept ans, une ancienneté très importante en IA : il est probablement dépassé par des embeddings multilingues plus récents et relève d’une génération souvent retirée des catalogues actuels. Usages pertinents : recherche sémantique multilingue sur passages courts, RAG avec segmentation, similarité de phrases et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).