sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 est un modèle d’embedding multilingue de Sentence Transformers, publié sous licence ouverte Apache 2.0. Fondé sur BERT, il compte 118 millions de paramètres, tous actifs, et produit des représentations denses de 384 dimensions.
sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2 est un modèle d’embedding multilingue de Sentence Transformers, publié sous licence ouverte Apache 2.0. Fondé sur BERT, il compte 118 millions de paramètres, tous actifs, et produit des représentations denses de 384 dimensions.
Le modèle traite des séquences allant jusqu’à 128 tokens et applique un pooling moyen aux représentations des tokens. Il transforme phrases et paragraphes en vecteurs destinés à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering. Il s’utilise avec Sentence-Transformers ou Hugging Face Transformers, à condition d’appliquer le pooling approprié.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 1 novembre 2019 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 118 millions |
| Paramètres actifs | 118 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 33,4 % | 158ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: BEIR-NL | 25,8 % | 13ᵉ / 16 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 20,9 % | 148ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 25,6 % | 170ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 28,9 % | 78ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 29,8 % | 84ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,0 % | 91ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 34,4 % | 120ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 51,7 % | 47ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 22,3 % | 123ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,3 % | 156ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Farsi | 51,3 % | 24ᵉ / 30 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: BEIR-NL
Notre analyse
Forces. Les évaluations MTEB montrent une couverture multilingue étendue, avec des résultats relativement mieux situés en coréen et des performances assez homogènes sur les ensembles European, French, Indic et Russian. Les tâches couvertes comprennent notamment la classification, le clustering, la recherche, le reranking, la classification de paires et le bitext mining. La représentation dense de 384 dimensions limite la taille des index et le coût de comparaison par rapport à des vecteurs plus larges. La licence Apache 2.0 facilite par ailleurs l’auto-hébergement et l’intégration dans des applications commerciales.
Limites et points d’attention. Les scores MTEB restent proches de la moitié des points possibles, avec des classements généralement intermédiaires ou bas, particulièrement sur le track Farsi. La longueur maximale de 128 tokens convient aux phrases et paragraphes courts, mais impose un découpage pour les documents longs. Sorti le 1 novembre 2019, ce modèle est très ancien à l’échelle de l’IA et probablement dépassé par des embeddings multilingues plus récents. Usages pertinents : recherche sémantique multilingue légère, RAG sur passages courts, détection de similarité et clustering sous licence ouverte.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).