sdadas/mmlw-roberta-large
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-large est un modèle d’embedding dense de 435 millions de paramètres, tous actifs. Initialisé à partir de Polish RoBERTa, cet encodeur de textes polonais produit des vecteurs de 1024 dimensions.
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-large est un modèle d’embedding dense de 435 millions de paramètres, tous actifs. Initialisé à partir de Polish RoBERTa, cet encodeur de textes polonais produit des vecteurs de 1024 dimensions.
Son entraînement repose sur une distillation multilingue à partir de paires polonais-anglais, avec English FlagEmbeddings (BGE) comme enseignant. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, au calcul de similarité et au clustering, avec une possibilité d’affinage ultérieur. Dans Sentence-Transformers, les requêtes doivent commencer par le préfixe « zapytanie: ».
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sdadas |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2023 |
| Dimension du vecteur | 1 024 |
| Représentation | dense |
| Paramètres | 435 millions |
| Paramètres actifs | 435 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 35,8 % | 152ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 37,4 % | 89ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 28,8 % | 152ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 39,2 % | 80ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 37,3 % | 102ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 47,8 % | 71ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 5,3 % | 176ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 13,6 % | 154ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 49,5 % | 63ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 40,5 % | 49ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 38,5 % | 77ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 32,6 % | 87ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB les plus favorables concernent le français et l’évaluation européenne, même si le modèle reste globalement au milieu du classement sur ces deux ensembles. Son niveau en allemand est également intermédiaire, ce qui confirme une certaine transférabilité au-delà du couple polonais-anglais employé pour la distillation. La licence Apache 2.0 autorise l’auto-hébergement, l’adaptation et les usages commerciaux. Les vecteurs denses de 1024 dimensions conviennent à la similarité sémantique, au clustering et à l’indexation de passages.
Limites et points d'attention. Les performances sont moins convaincantes sur MTEB Medical, Dutch et Long-context Retrieval, où le modèle se situe dans la moitié basse des classements. Il n’apparaît donc pas comme un choix prioritaire pour la recherche médicale, le néerlandais ou la récupération dans des documents longs. La dimension de 1024 alourdit aussi les index et augmente le coût de stockage et de recherche par rapport à des embeddings plus compacts. Sorti depuis près de trois ans, soit une ancienneté très importante à l’échelle de l’IA, il est probablement dépassé par des modèles plus récents et souvent retiré des catalogues actuels. Usages pertinents : projets polonais de recherche sémantique, de RAG ou de clustering nécessitant un modèle ouvert et auto-hébergeable.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).