lightonai/mDenseOn
Publié par lightonai le 30 juillet 2026, mDenseOn est un modèle d’embedding multilingue à poids ouverts sous licence Apache 2.0. Fondé sur mmBERT-base, il compte 307 millions de paramètres, dont 110 millions actifs, et produit une représentation dense unique de 768 dimensions. Sa…
Publié par lightonai le 30 juillet 2026, mDenseOn est un modèle d’embedding multilingue à poids ouverts sous licence Apache 2.0. Fondé sur mmBERT-base, il compte 307 millions de paramètres, dont 110 millions actifs, et produit une représentation dense unique de 768 dimensions. Sa longueur maximale atteint 8 192 jetons.
Le modèle couvre neuf langues, dont le français, l’anglais et l’arabe. Il encode séparément les requêtes et les documents grâce à des préfixes dédiés, puis mesure leur proximité par similarité cosinus. Cette architecture cible la recherche sémantique, l’indexation pour le RAG, la détection de similarités et le clustering de documents, y compris sur des contenus longs.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 30 juillet 2026 |
| Dimension du vecteur | 768 |
| Représentation | dense à vecteur unique |
| Paramètres | 307 millions |
| Paramètres actifs | 110 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 56,7 % | 28ᵉ / 197 | mteb | ✅ Mesuré |
| MTEB: Code Information Retrieval | 69,3 % | 25ᵉ / 51 | mteb | ✅ Mesuré |
| MTEB: Code | 71,5 % | 19ᵉ / 45 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
MTEB: Code Information Retrieval
Notre analyse
Forces. mDenseOn obtient son meilleur positionnement relatif sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Ce résultat soutient son emploi comme moteur de recherche dense généraliste. Son entraînement multilingue facilite la création d’un index commun à neuf langues. La fenêtre de 8 192 jetons convient aux documents longs et réduit le besoin de fragmenter fortement les contenus avant l’indexation. La licence Apache 2.0 et les poids ouverts autorisent l’auto-hébergement ainsi que l’intégration dans des infrastructures maîtrisées.
Limites et points d'attention. Les deux évaluations MTEB spécialisées placent mDenseOn dans la première moitié du classement, sans le situer parmi les modèles de tête. Sa représentation à vecteur unique privilégie une architecture d’indexation simple. Le prétraitement doit respecter les préfixes « query: » et « document: », ainsi que le pooling sur le jeton [CLS], faute de quoi les embeddings ne correspondent pas au schéma prévu. Les 768 dimensions imposent aussi un espace de stockage et un calcul de similarité à prendre en compte lors d’un déploiement à grande échelle. Usages pertinents : recherche sémantique multilingue, RAG sur documents longs, rapprochement de contenus et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark.