Sentence Transformers: all-mpnet-base-v2
Sentence Transformers: all-mpnet-base-v2 est un modèle d’embedding dense de 109 millions de paramètres, publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur microsoft/mpnet-base, il produit des vecteurs de 768 dimensions à partir de phrases et de courts paragraphes.
Sentence Transformers: all-mpnet-base-v2 est un modèle d’embedding dense de 109 millions de paramètres, publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur microsoft/mpnet-base, il produit des vecteurs de 768 dimensions à partir de phrases et de courts paragraphes.
Affiné par apprentissage contrastif sur des paires de phrases, il emploie un mean pooling et peut appliquer une normalisation L2. Il sert à la recherche sémantique, à l’indexation pour le RAG, au clustering et à la similarité de phrases. Les entrées dépassant 384 word pieces sont tronquées par défaut.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 109 millions |
| Paramètres actifs | 109 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 43,8 % | 132ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 31,1 % | 121ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: Reasoning Retrieval | 14,6 % | 17ᵉ / 29 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,3 % | 154ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 37,7 % | 72ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 55,9 % | 57ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 32,7 % | 106ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,4 % | 101ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 44,8 % | 96ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 12,6 % | 156ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 10,7 % | 174ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 69,8 % | 20ᵉ / 41 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,005 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB Chemical, où il se place dans la moitié supérieure du classement, ce qui indique une aptitude notable à représenter des textes du domaine chimique. RTEB Finance le situe plus près du milieu de tableau pour la recherche d’information financière. Ses vecteurs denses normalisables conviennent à la comparaison par similarité et au regroupement de contenus. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires ou ouverts. Son tarif d’entrée économique, établi à 0,005 dollar par million de tokens, réduit aussi le coût d’indexation.
Limites et points d'attention. Les positions sur MTEB European, BEIR, German et RTEB Healthcare sont moins favorables, ce qui invite à valider précisément la qualité sur les langues européennes, l’allemand, la recherche généraliste sans adaptation et les contenus médicaux. La limite de 384 word pieces impose de segmenter les documents longs, sous peine de perdre leur fin lors de la troncature. Les vecteurs de 768 dimensions entraînent également un stockage et un calcul de recherche supérieurs à ceux de représentations moins dimensionnées. Usages pertinents : recherche sémantique sur phrases ou courts paragraphes, RAG avec découpage préalable, similarité et clustering, notamment pour des corpus chimiques.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).