sdadas/mmlw-roberta-base
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-base est un encodeur de 124 millions de paramètres spécialisé dans les textes polonais. Initialisé à partir de Polish RoBERTa, il a été distillé au moyen d’un modèle enseignant English…
Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-base est un encodeur de 124 millions de paramètres spécialisé dans les textes polonais. Initialisé à partir de Polish RoBERTa, il a été distillé au moyen d’un modèle enseignant English FlagEmbeddings et de paires de textes polonais-anglais.
Le modèle transforme les textes en représentations denses de 768 dimensions. Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Le modèle peut aussi constituer une base pour un affinage ultérieur.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | sdadas |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 novembre 2023 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 124 millions |
| Paramètres actifs | 124 millions |
| Longueur de séquence max | 514 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 39,2 % | 142ᵉ / 192 | mteb | ✅ Mesuré |
| MTEB: Long-context Retrieval | 33,2 % | 111ᵉ / 170 | mteb | ✅ Mesuré |
| MTEB: RTEB Legal | 27,4 % | 161ᵉ / 208 | mteb | ✅ Mesuré |
| MTEB: Medical | 38,6 % | 85ᵉ / 158 | mteb | ✅ Mesuré |
| MTEB: Legal | 35,3 % | 115ᵉ / 157 | mteb | ✅ Mesuré |
| MTEB: European | 46,2 % | 86ᵉ / 128 | mteb | ✅ Mesuré |
| MTEB: RTEB French | 4,1 % | 180ᵉ / 218 | mteb | ✅ Mesuré |
| MTEB: RTEB German | 10,1 % | 176ᵉ / 209 | mteb | ✅ Mesuré |
| MTEB: French | 44,4 % | 88ᵉ / 117 | mteb | ✅ Mesuré |
| MTEB: German | 37,7 % | 64ᵉ / 96 | mteb | ✅ Mesuré |
| MTEB: Dutch | 36,4 % | 86ᵉ / 113 | mteb | ✅ Mesuré |
| MTEB: Indic | 31,0 % | 112ᵉ / 119 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Long-context Retrieval
Notre analyse
Forces. Les résultats MTEB sont relativement meilleurs sur les évaluations European et French, qui couvrent notamment la classification, le clustering, la comparaison de paires et le bitext mining. La distillation multilingue à partir de paires polonais-anglais renforce son intérêt pour la représentation de textes polonais et les rapprochements entre langues. La licence Apache 2.0 autorise l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Son architecture de 124 millions de paramètres reste adaptée à la production de vecteurs denses destinés à l’indexation.
Limites et points d'attention. Les classements MTEB placent le modèle dans la partie basse des tableaux European, French, German et Dutch. Les résultats sont encore plus modestes sur BEIR, consacré à la recherche zero-shot dans des domaines hétérogènes, tandis que le track Medical ne révèle pas de spécialisation clinique ou biomédicale marquée. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Avec Sentence-Transformers, chaque requête doit commencer par le préfixe « zapytanie: », faute de quoi la représentation peut ne pas correspondre au format d’entraînement. Usages pertinents : recherche sémantique et clustering de textes polonais, RAG auto-hébergé et affinage spécialisé.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).