emillykkejensen/mmBERTscandi-base-embedding
Publié par emillykkejensen le 17 octobre 2025, emillykkejensen/mmBERTscandi-base-embedding est un modèle d’embedding multilingue de 307 millions de paramètres, tous actifs. Dérivé de jonasaise/scandmmBERT-base-scandinavian, il produit des vecteurs denses de 768 dimensions et accepte des…
Publié par emillykkejensen le 17 octobre 2025, emillykkejensen/mmBERTscandi-base-embedding est un modèle d’embedding multilingue de 307 millions de paramètres, tous actifs. Dérivé de jonasaise/scandmmBERT-base-scandinavian, il produit des vecteurs denses de 768 dimensions et accepte des séquences allant jusqu’à 8 192 tokens.
Affiné avec nordic-embedding-training-data, il couvre les langues déclarées da, no, sw et sv. Son encodage distinct des requêtes et des documents cible la recherche sémantique, le RAG, la similarité, la détection de paraphrases, la classification et le clustering. La licence Apache 2.0 autorise son utilisation et son auto-hébergement dans des projets ouverts ou commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | emillykkejensen |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 17 octobre 2025 |
| Dimension du vecteur | 768 |
| Représentation | dense |
| Paramètres | 307 millions |
| Paramètres actifs | 307 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: Scandinavian | 52,1 % | 33ᵉ / 48 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: Scandinavian
Notre analyse
Forces. Le modèle est spécialisé dans les représentations scandinaves, avec une évaluation MTEB: Scandinavian couvrant notamment le danois, le suédois et le norvégien bokmål. Sa fenêtre de 8 192 tokens facilite l’encodage de documents et de passages longs. Le pooling moyen fournit une représentation unique par texte, tandis que la similarité cosinus permet de comparer directement requêtes et documents. La dimension de 768 offre un compromis exploitable pour l’indexation vectorielle. La licence Apache 2.0 constitue également un atout pour le déploiement et l’auto-hébergement.
Limites et points d'attention. Son résultat global sur MTEB: Scandinavian, classé 33e sur 48 modèles, le situe dans la partie basse du classement plutôt que parmi les références de cette évaluation. Avec 307 millions de paramètres actifs, son exécution exige davantage de ressources qu’un encodeur plus petit. Les vecteurs denses de 768 dimensions impliquent aussi un index et des calculs de similarité plus lourds que des représentations de dimension inférieure. Usages pertinents : recherche sémantique scandinave, couche de retrieval d’un système RAG, détection de paraphrases, classification et clustering de textes.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).