sdadas/mmlw-roberta-base

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-base est un encodeur de 124 millions de paramètres spécialisé dans les textes polonais. Initialisé à partir de Polish RoBERTa, il a été distillé au moyen d’un modèle enseignant English…

Publié par sdadas le 17 novembre 2023 sous licence ouverte Apache 2.0, sdadas/mmlw-roberta-base est un encodeur de 124 millions de paramètres spécialisé dans les textes polonais. Initialisé à partir de Polish RoBERTa, il a été distillé au moyen d’un modèle enseignant English FlagEmbeddings et de paires de textes polonais-anglais.

Le modèle transforme les textes en représentations denses de 768 dimensions. Ces vecteurs servent à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Le modèle peut aussi constituer une base pour un affinage ultérieur.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeursdadas
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie17 novembre 2023
Dimension du vecteur768
Représentationdense
Paramètres124 millions
Paramètres actifs124 millions
Longueur de séquence max514 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR39,2 %142ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval33,2 %111ᵉ / 170mteb✅ Mesuré
MTEB: RTEB Legal27,4 %161ᵉ / 208mteb✅ Mesuré
MTEB: Medical38,6 %85ᵉ / 158mteb✅ Mesuré
MTEB: Legal35,3 %115ᵉ / 157mteb✅ Mesuré
MTEB: European46,2 %86ᵉ / 128mteb✅ Mesuré
MTEB: RTEB French4,1 %180ᵉ / 218mteb✅ Mesuré
MTEB: RTEB German10,1 %176ᵉ / 209mteb✅ Mesuré
MTEB: French44,4 %88ᵉ / 117mteb✅ Mesuré
MTEB: German37,7 %64ᵉ / 96mteb✅ Mesuré
MTEB: Dutch36,4 %86ᵉ / 113mteb✅ Mesuré
MTEB: Indic31,0 %112ᵉ / 119mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ sdadas/mmlw-roberta-base39 %
deepfile/embedder-100p39 %

MTEB: Long-context Retrieval

▶ sdadas/mmlw-roberta-base33 %

Notre analyse

Forces. Les résultats MTEB sont relativement meilleurs sur les évaluations European et French, qui couvrent notamment la classification, le clustering, la comparaison de paires et le bitext mining. La distillation multilingue à partir de paires polonais-anglais renforce son intérêt pour la représentation de textes polonais et les rapprochements entre langues. La licence Apache 2.0 autorise l’auto-hébergement, la modification et l’intégration dans des applications commerciales. Son architecture de 124 millions de paramètres reste adaptée à la production de vecteurs denses destinés à l’indexation.

Limites et points d'attention. Les classements MTEB placent le modèle dans la partie basse des tableaux European, French, German et Dutch. Les résultats sont encore plus modestes sur BEIR, consacré à la recherche zero-shot dans des domaines hétérogènes, tandis que le track Medical ne révèle pas de spécialisation clinique ou biomédicale marquée. Sorti en 2023, il est ancien à l’échelle de l’IA et probablement dépassé par des embeddings plus récents. Avec Sentence-Transformers, chaque requête doit commencer par le préfixe « zapytanie: », faute de quoi la représentation peut ne pas correspondre au format d’entraînement. Usages pertinents : recherche sémantique et clustering de textes polonais, RAG auto-hébergé et affinage spécialisé.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).