lightonai/mDenseOn

Publié par lightonai le 30 juillet 2026, mDenseOn est un modèle d’embedding multilingue à poids ouverts sous licence Apache 2.0. Fondé sur mmBERT-base, il compte 307 millions de paramètres, dont 110 millions actifs, et produit une représentation dense unique de 768 dimensions. Sa…

Publié par lightonai le 30 juillet 2026, mDenseOn est un modèle d’embedding multilingue à poids ouverts sous licence Apache 2.0. Fondé sur mmBERT-base, il compte 307 millions de paramètres, dont 110 millions actifs, et produit une représentation dense unique de 768 dimensions. Sa longueur maximale atteint 8 192 jetons.

Le modèle couvre neuf langues, dont le français, l’anglais et l’arabe. Il encode séparément les requêtes et les documents grâce à des préfixes dédiés, puis mesure leur proximité par similarité cosinus. Cette architecture cible la recherche sémantique, l’indexation pour le RAG, la détection de similarités et le clustering de documents, y compris sur des contenus longs.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 juillet 2026
Dimension du vecteur768
Représentationdense à vecteur unique
Paramètres307 millions
Paramètres actifs110 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR56,7 %28ᵉ / 197mteb✅ Mesuré
MTEB: Code Information Retrieval69,3 %25ᵉ / 51mteb✅ Mesuré
MTEB: Code71,5 %19ᵉ / 45mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ lightonai/mDenseOn57 %

MTEB: Code Information Retrieval

▶ lightonai/mDenseOn69 %
Shuu12121/NightOwl-Code…69 %

Notre analyse

Forces. mDenseOn obtient son meilleur positionnement relatif sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Ce résultat soutient son emploi comme moteur de recherche dense généraliste. Son entraînement multilingue facilite la création d’un index commun à neuf langues. La fenêtre de 8 192 jetons convient aux documents longs et réduit le besoin de fragmenter fortement les contenus avant l’indexation. La licence Apache 2.0 et les poids ouverts autorisent l’auto-hébergement ainsi que l’intégration dans des infrastructures maîtrisées.

Limites et points d'attention. Les deux évaluations MTEB spécialisées placent mDenseOn dans la première moitié du classement, sans le situer parmi les modèles de tête. Sa représentation à vecteur unique privilégie une architecture d’indexation simple. Le prétraitement doit respecter les préfixes « query: » et « document: », ainsi que le pooling sur le jeton [CLS], faute de quoi les embeddings ne correspondent pas au schéma prévu. Les 768 dimensions imposent aussi un espace de stockage et un calcul de similarité à prendre en compte lors d’un déploiement à grande échelle. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, rapprochement de contenus et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark.