sdadas/mmlw-e5-large
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-large est un modèle d’embedding dense de 560 millions de paramètres. Initialisé à partir de multilingual E5, puis entraîné par distillation multilingue sur des paires polonais-anglais, cet encodeur est…
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-e5-large est un modèle d’embedding dense de 560 millions de paramètres. Initialisé à partir de multilingual E5, puis entraîné par distillation multilingue sur des paires polonais-anglais, cet encodeur est principalement orienté vers les textes polonais.
Chaque texte est converti en un vecteur de 1024 dimensions, exploitable pour la recherche sémantique, le RAG, la mesure de similarité et le clustering. Le modèle distingue les requêtes et les documents au moyen des préfixes « query: » et « passage: », et peut également servir de base à un affinage spécialisé.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sdadas |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 560 millions |
| Paramètres actifs | 560 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 37,0 % | 149ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 40,2 % | 72ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 30,9 % | 136ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 41,0 % | 65ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 39,3 % | 86ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 48,9 % | 63ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 9,9 % | 161ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 16,8 % | 128ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 52,6 % | 44ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 42,4 % | 44ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 39,7 % | 73ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 36,6 % | 58ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Le meilleur résultat MTEB du modèle concerne le français, où il se place dans la première moitié du classement. Les évaluations European et German indiquent aussi une aptitude multilingue exploitable pour la classification, le clustering, la comparaison de paires et certaines tâches de recherche. Les résultats en Medical et en Long-context Retrieval restent également dans la première moitié de leurs classements respectifs. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, tandis que l’entraînement polonais-anglais constitue un atout pour les corpus centrés sur le polonais ou associant ces deux langues.
Limites et points d'attention. Le track Dutch est le moins favorable en position relative, avec un classement dans la seconde moitié. Les performances European et German demeurent intermédiaires plutôt que dominantes, et les résultats médicaux ou sur le contexte long ne signalent pas une spécialisation de premier plan. Les vecteurs de 1024 dimensions alourdissent les index et rendent la recherche plus coûteuse que des représentations plus compactes. Avec environ trois ans d’ancienneté, durée très longue à l’échelle de l’IA, ce modèle de 2023 est probablement dépassé par des embeddings plus récents. Usages pertinents : recherche sémantique, RAG, similarité et clustering de corpus multilingues, notamment polonais-anglais, après validation sur les données visées.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).