sdadas/mmlw-e5-large

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-large est un modèle d’embedding dense de 560 millions de paramètres. Initialisé à partir de multilingual E5, puis entraîné par distillation multilingue sur des paires polonais-anglais, cet encodeur est…

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-large est un modèle d’embedding dense de 560 millions de paramètres. Initialisé à partir de multilingual E5, puis entraîné par distillation multilingue sur des paires polonais-anglais, cet encodeur est principalement orienté vers les textes polonais.

Chaque texte est converti en un vecteur de 1024 dimensions, exploitable pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Le modèle distingue les requêtes et les documents au moyen des préfixes « query: » et « passage: », et peut également servir de base à un affinage spécialisé.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursdadas
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 novembre 2023
Dimension du vecteur1 024
Représentationdense
Paramètres560 millions
Paramètres actifs560 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR37,0 %149ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval40,2 %72ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal30,9 %136ᵉ / 208mteb✅ Mesuré
MTEB: Medical41,0 %65ᵉ / 158mteb✅ Mesuré
MTEB: Legal39,3 %86ᵉ / 157mteb✅ Mesuré
MTEB: European48,9 %63ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French9,9 %161ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German16,8 %128ᵉ / 209mteb✅ Mesuré
MTEB: French52,6 %44ᵉ / 117mteb✅ Mesuré
MTEB: German42,4 %44ᵉ / 96mteb✅ Mesuré
MTEB: Dutch39,7 %73ᵉ / 113mteb✅ Mesuré
MTEB: Indic36,6 %58ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

deepfile/embedder-100p39 %
▶ sdadas/mmlw-e5-large37 %
Hum-Works/lodestone-bas…37 %

MTEB: Long-context Retrieval

w601sxs/b1ade-embed40 %
▶ sdadas/mmlw-e5-large40 %
WhereIsAI/UAE-Large-V140 %

Notre analyse

Forces. Le meilleur résultat MTEB du modèle concerne le français, où il se place dans la première moitié du classement. Les évaluations European et German indiquent aussi une aptitude multilingue exploitable pour la classification, le clustering, la comparaison de paires et certaines tâches de recherche. Les résultats en Medical et en Long-context Retrieval restent également dans la première moitié de leurs classements respectifs. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, tandis que l’entraînement polonais-anglais constitue un atout pour les corpus centrés sur le polonais ou associant ces deux langues.

Limites et points d'attention. Le track Dutch est le moins favorable en position relative, avec un classement dans la seconde moitié. Les performances European et German demeurent intermédiaires plutôt que dominantes, et les résultats médicaux ou sur le contexte long ne signalent pas une spécialisation de premier plan. Les vecteurs de 1024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2023 est probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering de corpus multilingues, notamment polonais-anglais, après validation sur les données visées.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).