sdadas/mmlw-e5-small
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-small est un encodeur dense de 118 millions de paramètres. Distillé à partir d’un checkpoint multilingual E5 avec des modèles BGE anglophones comme enseignants, il a été entraîné sur des paires de…
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-small est un encodeur dense de 118 millions de paramètres. Distillé à partir d’un checkpoint multilingual E5 avec des modèles BGE anglophones comme enseignants, il a été entraîné sur des paires de textes polonais-anglais et produit des vecteurs de 384 dimensions.
Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son format relativement compact facilite la constitution d’index vectoriels légers. Les requêtes doivent être préfixées par « query: » et les passages par « passage: ».
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sdadas |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2023 |
| Dimension du vecteur | 384 |
| Représentation | dense |
| Paramètres | 118 millions |
| Paramètres actifs | 118 millions |
| Longueur de séquence max | 512 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 33,5 % | 157ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 32,8 % | 112ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,2 % | 155ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 35,3 % | 100ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,7 % | 112ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 45,6 % | 93ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 3,4 % | 186ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 9,2 % | 178ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 45,8 % | 83ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,2 % | 64ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: German | 35,6 % | 73ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 34,5 % | 91ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les meilleurs résultats MTEB de sdadas/mmlw-e5-small apparaissent sur les tracks French et European, ce qui met en avant son orientation multilingue pour la classification, le clustering, la comparaison de paires et certaines tâches de recherche interlangue. Sa dimension de 384 réduit la taille des index et le volume de calcul associé aux comparaisons, tandis que ses 118 millions de paramètres restent adaptés à un déploiement contenu. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, notamment comme point de départ pour un affinement spécialisé.
Limites et points d'attention. Les classements MTEB restent modestes sur French et European, et deviennent plus faibles sur German, Legal et Medical. Indic se situe davantage au milieu du classement, mais avec une qualité mesurée inférieure à celle des deux meilleurs tracks du modèle. Sorti fin 2023, il approche trois ans, une ancienneté très longue à l’échelle de l’IA, et paraît probablement dépassé par des embeddings plus récents de sa catégorie. Le respect des préfixes « query: » et « passage: » constitue aussi une contrainte d’intégration. Usages pertinents : indexation compacte, recherche sémantique et clustering de textes, particulièrement dans des pipelines polonais-anglais ou européens pouvant être affinés.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).