sentence-transformers/multi-qa-MiniLM-L6-cos-v1

Publié par Sentence Transformers le 30 août 2021 sous licence ouverte Apache 2.0, sentence-transformers/multi-qa-MiniLM-L6-cos-v1 est un modèle d’embedding dense de 23 millions de paramètres. Fondé sur MiniLM-L6-H384-uncased, il produit des vecteurs normalisés de 384 dimensions par mean…

Publié par Sentence Transformers le 30 août 2021 sous licence ouverte Apache 2.0, sentence-transformers/multi-qa-MiniLM-L6-cos-v1 est un modèle d’embedding dense de 23 millions de paramètres. Fondé sur MiniLM-L6-H384-uncased, il produit des vecteurs normalisés de 384 dimensions par mean pooling.

Principalement adapté aux contenus anglophones, il encode requêtes, questions, phrases et paragraphes pour la recherche sémantique, le RAG, la similarité et le clustering. Les entrées sont limitées à 512 word pieces, avec troncature au-delà. Les vecteurs se comparent par produit scalaire, similarité cosinus ou distance euclidienne.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurSentence Transformers
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 août 2021
Dimension du vecteur384
Représentationdense
Paramètres23 millions
Paramètres actifs23 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: RTEB Legal28,8 %151ᵉ / 208mteb✅ Mesuré
MTEB: RTEB Healthcare32,1 %76ᵉ / 97mteb✅ Mesuré
MTEB: RTEB Finance46,2 %75ᵉ / 97mteb✅ Mesuré
MTEB: RTEB French11,1 %157ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,2 %134ᵉ / 209mteb✅ Mesuré
MTEB: Dutch34,6 %90ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: RTEB Finance

nvidia/Nemotron-3-Embed…88 %
voyageai/voyage-4-large…87 %
bisectgroup/BiCA-base54 %
▶ sentence-transformers/m…46 %

MTEB: Dutch

▶ sentence-transformers/m…35 %

Notre analyse

Forces. Son meilleur résultat MTEB relatif apparaît sur RTEB Finance, ce qui en fait surtout un candidat pour la recherche de questions-réponses et de contenus financiers. RTEB Healthcare et Dutch restent ses autres pistes les plus crédibles, bien que leurs classements soient modestes. L’entraînement contrastif sur environ 215 millions de paires question-réponse correspond directement aux usages de retrieval. Les vecteurs de 384 dimensions permettent des index relativement légers, tandis que la licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale.

Limites et points d’attention. Les résultats sont faibles sur RTEB Legal, plus encore sur RTEB German et RTEB French, ce qui limite son intérêt pour la recherche juridique et les corpus non anglophones. La limite de 512 word pieces impose de découper ou tronquer les documents longs, et l’entraînement n’a porté que sur des textes allant jusqu’à 250 word pieces. Sorti il y a près de cinq ans, un âge très important à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche sémantique anglophone, RAG compact, déduplication, similarité et clustering sur des passages courts.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).