sentence-transformers/multi-qa-MiniLM-L6-cos-v1
Publié par Sentence Transformers le 30 août 2021 sous licence ouverte Apache 2.0, sentence-transformers/multi-qa-MiniLM-L6-cos-v1 est un modèle d’embedding dense de 23 millions de paramètres. Fondé sur MiniLM-L6-H384-uncased, il produit des vecteurs normalisés de 384 dimensions par mean…
Publié par Sentence Transformers le 30 août 2021 sous licence ouverte Apache 2.0, sentence-transformers/multi-qa-MiniLM-L6-cos-v1 est un modèle d’embedding dense de 23 millions de paramètres. Fondé sur MiniLM-L6-H384-uncased, il produit des vecteurs normalisés de 384 dimensions par mean pooling.
Principalement adapté aux contenus anglophones, il encode requêtes, questions, phrases et paragraphes pour la recherche sémantique, le RAG, la similarité et le clustering. Les entrées sont limitées à 512 word pieces, avec troncature au-delà. Les vecteurs se comparent par produit scalaire, similarité cosinus ou distance euclidienne.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | Sentence Transformers |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 août 2021 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 23 millions |
| Paramètres actifs | 23 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: RTEB Legal | 28,8 % | 151ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: RTEB Healthcare | 32,1 % | 76ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB Finance | 46,2 % | 75ᵉ / 97 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 11,1 % | 157ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,2 % | 134ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: Dutch | 34,6 % | 90ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: RTEB Finance
MTEB: Dutch
Notre analyse
Forces. Son meilleur résultat MTEB relatif apparaît sur RTEB Finance, ce qui en fait surtout un candidat pour la recherche de questions-réponses et de contenus financiers. RTEB Healthcare et Dutch restent ses autres pistes les plus crédibles, bien que leurs classements soient modestes. L’entraînement contrastif sur environ 215 millions de paires question-réponse correspond directement aux usages de retrieval. Les vecteurs de 384 dimensions permettent des index relativement légers, tandis que la licence Apache 2.0 facilite l’auto-hébergement et l’intégration commerciale.
Limites et points d’attention. Les résultats sont faibles sur RTEB Legal, plus encore sur RTEB German et RTEB French, ce qui limite son intérêt pour la recherche juridique et les corpus non anglophones. La limite de 512 word pieces impose de découper ou tronquer les documents longs, et l’entraînement n’a porté que sur des textes allant jusqu’à 250 word pieces. Sorti il y a près de cinq ans, un âge très important à l’échelle de l’IA, ce modèle est probablement dépassé par des embeddings plus récents et souvent retiré des catalogues actuels. Usages pertinents : recherche sémantique anglophone, RAG compact, déduplication, similarité et clustering sur des passages courts.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).