sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2

sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 est un modèle d’embedding multilingue de Sentence Transformers, publié sous licence ouverte Apache 2.0. Fondé sur BERT, il compte 118 millions de paramètres, tous actifs, et produit des représentations denses de 384 dimensions.

sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 est un modèle d’embedding multilingue de Sentence Transformers, publié sous licence ouverte Apache 2.0. Fondé sur BERT, il compte 118 millions de paramètres, tous actifs, et produit des représentations denses de 384 dimensions.

Le modèle traite des séquences allant jusqu’à 128 tokens et applique un pooling moyen aux représentations des tokens. Il transforme phrases et paragraphes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il s’utilise avec Sentence-Transformers ou Hugging Face Transformers, à condition d’appliquer le pooling approprié.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie1 novembre 2019
Dimension du vecteur384
Représentationdense
Paramètres118 millions
Paramètres actifs118 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR33,4 %158ᵉ / 192mteb✅ Mesuré
MTEB: BEIR-NL25,8 %13ᵉ / 16mteb✅ Mesuré
MTEB: Long-context Retrieval20,9 %148ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal25,6 %170ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare28,9 %78ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance29,8 %84ᵉ / 97mteb✅ Mesuré
MTEB: Medical38,0 %91ᵉ / 158mteb✅ Mesuré
MTEB: Legal34,4 %120ᵉ / 157mteb✅ Mesuré
MTEB: European51,7 %47ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French22,3 %123ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German13,3 %156ᵉ / 209mteb✅ Mesuré
MTEB: Farsi51,3 %24ᵉ / 30mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les évaluations MTEB montrent une couverture multilingue étendue, avec des résultats relativement mieux situés en coréen et des performances assez homogènes sur les ensembles European, French, Indic et Russian. Les tâches couvertes comprennent notamment la classification, le clustering, la recherche, le reranking, la classification de paires et le bitext mining. La représentation dense de 384 dimensions limite la taille des index et le coût de comparaison par rapport à des vecteurs plus larges. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.

Limites et points d’attention. Les scores MTEB restent proches de la moitié des points possibles, avec des classements généralement intermédiaires ou bas, particulièrement sur le track Farsi. La longueur maximale de 128 tokens convient aux phrases et paragraphes courts, mais impose un découpage pour les documents longs. Sorti le 1 novembre 2019, ce modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings multilingues plus récents. Usages pertinents : recherche sémantique multilingue légère, RAG sur passages courts, détection de similarité et clustering sous licence ouverte.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).