Sentence Transformers: all-MiniLM-L6-v2

Sentence Transformers: all-MiniLM-L6-v2 est un modèle d’embedding à poids ouverts de Sentence Transformers, publié sous licence Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs denses de 384 dimensions. Fondé sur MiniLM-L6-H384-uncased, il vise principalement les textes…

Sentence Transformers: all-MiniLM-L6-v2 est un modèle d’embedding à poids ouverts de Sentence Transformers, publié sous licence Apache 2.0. Ses 23 millions de paramètres produisent des vecteurs denses de 384 dimensions. Fondé sur MiniLM-L6-H384-uncased, il vise principalement les textes anglophones. Les entrées dépassant 256 word pieces sont tronquées.

Le modèle encode des phrases et de courts paragraphes pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Il s’intègre à sentence-transformers ou à Hugging Face Transformers, avec mean pooling selon le masque d’attention et normalisation L2. Son tarif d’entrée économique atteint 0,005 $ par million de tokens.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 novembre 2025
Dimension du vecteur384
Représentationdense
Paramètres23 millions
Paramètres actifs23 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embeddings

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR41,9 %137ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval29,8 %127ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal27,8 %158ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare34,7 %74ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance43,8 %77ᵉ / 97mteb✅ Mesuré
MTEB: Medical29,8 %115ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,4 %113ᵉ / 157mteb✅ Mesuré
MTEB: European43,4 %101ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French10,2 %158ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German11,8 %165ᵉ / 209mteb✅ Mesuré
MTEB: Chemical69,6 %21ᵉ / 41mteb✅ Mesuré
MTEB: French45,2 %86ᵉ / 117mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

brahmairesearch/slx-v0.142 %
▶ …42 %

MTEB: Long-context Retrieval

brahmairesearch/slx-v0.130 %
▶ …30 %
deepfile/embedder-100p30 %

Tarifs

FournisseurPrix / 1M tokens
DeepInfra0,005 $

Prix en dollars US par million de tokens.

Sa tarification se situe 89 % en dessous de la moyenne des modèles d'embedding similaires.

Notre analyse

Forces. Le meilleur résultat relatif du modèle apparaît sur MTEB Chemical, où il se place dans la première moitié du classement. Il convient donc davantage aux tâches d’embedding de textes chimiques mêlant classification, clustering et rapprochement de contenus. Ses vecteurs de 384 dimensions permettent de constituer des index compacts, avec une empreinte de stockage et un coût de recherche contenus. La licence Apache 2.0 autorise l’auto-hébergement. Le prix est aussi 89 % inférieur à la moyenne des modèles d’embedding similaires.

Limites et points d'attention. Le modèle est en retrait sur MTEB French, RTEB Finance, MTEB European et BEIR. Il figure aussi près du bas du classement sur MTEB Scandinavian. Son orientation principalement anglophone limite son intérêt pour les corpus européens et scandinaves. La troncature au-delà de 256 word pieces impose de découper les documents longs avant indexation, ce qui ajoute une étape au pipeline RAG. Usages pertinents : recherche sémantique anglophone à faible coût, index compacts, déduplication, similarité de phrases et clustering de passages courts.


Sources des données : OpenRouter (openrouter.ai) · MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).