sdadas/mmlw-e5-small

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-small est un encodeur dense de 118 millions de paramètres. Distillé à partir d’un checkpoint multilingual E5 avec des modèles BGE anglophones comme enseignants, il a été entraîné sur des paires de…

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-small est un encodeur dense de 118 millions de paramètres. Distillé à partir d’un checkpoint multilingual E5 avec des modèles BGE anglophones comme enseignants, il a été entraîné sur des paires de textes polonais-anglais et produit des vecteurs de 384 dimensions.

Le modèle transforme les textes en représentations numériques destinées à la recherche sémantique, au RAG, à la mesure de similarité et au clustering. Son format relativement compact facilite la constitution d’index vectoriels légers. Les requêtes doivent être préfixées par « query: » et les passages par « passage: ».

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursdadas
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 novembre 2023
Dimension du vecteur384
Représentationdense
Paramètres118 millions
Paramètres actifs118 millions
Longueur de séquence max512 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR33,5 %157ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval32,8 %112ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal28,2 %155ᵉ / 208mteb✅ Mesuré
MTEB: Medical35,3 %100ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,7 %112ᵉ / 157mteb✅ Mesuré
MTEB: European45,6 %93ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French3,4 %186ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German9,2 %178ᵉ / 209mteb✅ Mesuré
MTEB: French45,8 %83ᵉ / 117mteb✅ Mesuré
MTEB: Indic36,2 %64ᵉ / 119mteb✅ Mesuré
MTEB: German35,6 %73ᵉ / 96mteb✅ Mesuré
MTEB: Dutch34,5 %91ᵉ / 113mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. Les meilleurs résultats MTEB de sdadas/mmlw-e5-small apparaissent sur les tracks French et European, ce qui met en avant son orientation multilingue pour la classification, le clustering, la comparaison de paires et certaines tâches de recherche interlangue. Sa dimension de 384 réduit la taille des index et le volume de calcul associé aux comparaisons, tandis que ses 118 millions de paramètres restent adaptés à un déploiement contenu. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, notamment comme point de départ pour un affinement spécialisé.

Limites et points d'attention. Les classements MTEB restent modestes sur French et European, et deviennent plus faibles sur German, Legal et Medical. Indic se situe davantage au milieu du classement, mais avec une qualité mesurée inférieure à celle des deux meilleurs tracks du modèle. Sorti fin 2023, il approche trois ans, une ancienneté très longue à l’échelle de l’IA, et paraît probablement dépassé par des embeddings plus récents de sa catégorie. Le respect des préfixes « query: » et « passage: » constitue aussi une contrainte d’intégration. Usages pertinents : indexation compacte, recherche sémantique et clustering de textes, particulièrement dans des pipelines polonais-anglais ou européens pouvant être affinés.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).