Sentence Transformers: all-mpnet-base-v2

Sentence Transformers: all-mpnet-base-v2 est un modèle d’embedding dense de 109 millions de paramètres, publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur microsoft/mpnet-base, il produit des vecteurs de 768 dimensions à partir de phrases et de courts paragraphes.

Sentence Transformers: all-mpnet-base-v2 est un modèle d’embedding dense de 109 millions de paramètres, publié par Sentence Transformers sous licence ouverte Apache 2.0. Fondé sur microsoft/mpnet-base, il produit des vecteurs de 768 dimensions à partir de phrases et de courts paragraphes.

Affiné par apprentissage contrastif sur des paires de phrases, il emploie un mean pooling et peut appliquer une normalisation L2. Il sert à la recherche sémantique, à l’indexation pour le RAG, au clustering et à la similarité de phrases. Les entrées dépassant 384 word pieces sont tronquées par défaut.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 novembre 2025
Dimension du vecteur768
Représentationdense
Paramètres109 millions
Paramètres actifs109 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR43,8 %132ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval31,1 %121ᵉ / 170mteb✅ Mesuré
MTEB: Reasoning Retrieval14,6 %17ᵉ / 29mteb✅ Mesuré
MTEB: RTEB Legal28,3 %154ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare37,7 %72ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance55,9 %57ᵉ / 97mteb✅ Mesuré
MTEB: Medical32,7 %106ᵉ / 158mteb✅ Mesuré
MTEB: Legal37,4 %101ᵉ / 157mteb✅ Mesuré
MTEB: European44,8 %96ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French12,6 %156ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German10,7 %174ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,8 %20ᵉ / 41mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,005 $

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB Chemical, où il se place dans la moitié supérieure du classement, ce qui indique une aptitude notable à représenter des textes du domaine chimique. RTEB Finance le situe plus près du milieu de tableau pour la recherche d’information financière. Ses vecteurs denses normalisables conviennent à la comparaison par similarité et au regroupement de contenus. La licence Apache 2.0 facilite l’auto-hébergement et l’intégration dans des systèmes propriétaires ou ouverts. Son tarif d’entrée économique, établi à 0,005 dollar par million de tokens, réduit aussi le coût d’indexation.

Limites et points d'attention. Les positions sur MTEB European, BEIR, German et RTEB Healthcare sont moins favorables, ce qui invite à valider précisément la qualité sur les langues européennes, l’allemand, la recherche généraliste sans adaptation et les contenus médicaux. La limite de 384 word pieces impose de segmenter les documents longs, sous peine de perdre leur fin lors de la troncature. Les vecteurs de 768 dimensions entraînent également un stockage et un calcul de recherche supérieurs à ceux de représentations moins dimensionnées. Usages pertinents : recherche sémantique sur phrases ou courts paragraphes, RAG avec découpage préalable, similarité et clustering, notamment pour des corpus chimiques.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).