Sentence Transformers: all-MiniLM-L12-v2
Sentence Transformers: all-MiniLM-L12-v2 est un modèle d’embedding anglophone de Sentence Transformers, publié sous licence ouverte Apache 2.0. Ses 33 millions de paramètres produisent des vecteurs denses de 384 dimensions. Fondé sur microsoft/MiniLM-L12-H384-uncased, il a été affiné…
Sentence Transformers: all-MiniLM-L12-v2 est un modèle d’embedding anglophone de Sentence Transformers, publié sous licence ouverte Apache 2.0. Ses 33 millions de paramètres produisent des vecteurs denses de 384 dimensions. Fondé sur microsoft/MiniLM-L12-H384-uncased, il a été affiné avec un objectif contrastif sur plus d’un milliard de paires de phrases.
Le modèle encode des phrases et de courts paragraphes pour la recherche sémantique, la récupération de passages dans un système RAG, la similarité et le clustering. Les entrées sont limitées par défaut à 256 word pieces, au-delà desquelles elles sont tronquées. L’intégration est possible avec sentence-transformers ou Hugging Face Transformers, avec mean pooling et normalisation L2.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 18 novembre 2025 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 33 millions |
| Paramètres actifs | 33 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embeddings |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 42,7 % | 135ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 25,3 % | 141ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 25,6 % | 171ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 35,8 % | 73ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 43,3 % | 78ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: Medical | 33,2 % | 103ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 33,9 % | 121ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 44,4 % | 98ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 12,9 % | 155ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 7,4 % | 186ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Chemical | 69,0 % | 28ᵉ / 41 | mteb | ✅ Mesuré |
| MTEB: German | 37,1 % | 66ᵉ / 96 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Tarifs
| Fournisseur | Prix / 1M tokens |
|---|---|
| DeepInfra | 0,005 $ |
Prix en dollars US par million de tokens.
Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.
Notre analyse
Forces. Le meilleur résultat MTEB du modèle concerne Chemical, ce qui en fait son terrain d’évaluation le plus favorable pour l’exploration de textes spécialisés, notamment en classification, clustering et rapprochement de contenus. Sa représentation dense de 384 dimensions offre un compromis compact pour limiter la taille des index vectoriels et le coût de la recherche. La licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des applications commerciales. Son tarif économique, établi à 0,005 $ par million de tokens en entrée et 89 % sous la moyenne des modèles similaires, convient aux traitements volumineux.
Limites et points d'attention. Les résultats MTEB sont plus modestes sur European, German, BEIR, RTEB Finance et RTEB Healthcare, avec des classements situés dans la partie basse des ensembles comparés. Le modèle apparaît donc moins adapté aux corpus européens ou allemands, ainsi qu’à la recherche généraliste, financière et médicale exigeante. Son orientation anglophone réduit l’intérêt pour les déploiements multilingues. La limite de 256 word pieces entraîne la troncature des textes longs et impose leur segmentation avant indexation. Usages pertinents : recherche sémantique anglophone, RAG sur passages courts, détection de similarité et clustering à coût réduit.
Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).