sdadas/mmlw-e5-base
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Orienté vers le polonais, il dérive de multilingual E5 et a été entraîné par distillation multilingue sur des paires de textes…
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-base est un modèle d’embedding dense de 278 millions de paramètres. Orienté vers le polonais, il dérive de multilingual E5 et a été entraîné par distillation multilingue sur des paires de textes polonais et anglais.
Chaque texte est converti en un vecteur de 768 dimensions, exploitable pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Les requêtes doivent être précédées de « query: » et les passages de « passage: ». Le modèle peut aussi servir de base à un affinage spécialisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sdadas |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 278 millions |
| Paramètres actifs | 278 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 39,2 % | 144ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 34,2 % | 108ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 29,9 % | 142ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,8 % | 76ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,7 % | 98ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,5 % | 83ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 6,8 % | 167ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 12,6 % | 160ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 47,3 % | 76ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 38,4 % | 62ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,9 % | 55ᵉ / 119 | mteb | ✅ Mesuré |
| MTEB: Dutch | 36,6 % | 84ᵉ / 113 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB font ressortir les évaluations French et European comme ses meilleurs axes relatifs, devant les domaines médical et juridique ainsi que BEIR. Cette hiérarchie correspond à son héritage multilingue et à son entraînement polonais-anglais, avec un intérêt pour la représentation de textes dans plusieurs langues européennes. Sa sortie dense de 768 dimensions offre un format courant pour constituer des index vectoriels. La licence Apache 2.0 autorise l’auto-hébergement, l’adaptation et l’intégration dans des applications commerciales.
Limites et points d'attention. Malgré ses meilleurs scores relatifs en French et European, ses rangs restent dans la partie basse des classements concernés. Les résultats sont encore plus modestes sur BEIR, qui mesure la recherche zero-shot dans des tâches et domaines hétérogènes, ainsi que sur les corpus allemands et juridiques. Le médical se situe également loin des premières places. Sorti en 2023, ce modèle est très ancien à l’échelle de l’IA, probablement dépassé par des embeddings plus récents et souvent retiré des catalogues actifs. Usages pertinents : prototypes auto-hébergés, recherche polonaise ou européenne, clustering et base d’affinage spécialisé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).