lightonai/DenseOn

Publié par lightonai le 21 avril 2026, DenseOn est un modèle d’embedding anglophone de 149 millions de paramètres, fondé sur ModernBERT-base. Il produit une représentation dense à vecteur unique de 768 dimensions et accepte des séquences atteignant 512 tokens.

Publié par lightonai le 21 avril 2026, DenseOn est un modèle d’embedding anglophone de 149 millions de paramètres, fondé sur ModernBERT-base. Il produit une représentation dense à vecteur unique de 768 dimensions et accepte des séquences atteignant 512 tokens.

DenseOn transforme séparément les requêtes et les documents en vecteurs comparables par similarité cosinus. Il sert notamment à la recherche sémantique, à la récupération de passages pour le RAG, au rapprochement de textes similaires et au clustering. Sa licence ouverte Apache 2.0 autorise son déploiement et son adaptation dans une infrastructure maîtrisée.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie21 avril 2026
Dimension du vecteur768
Représentationdense à vecteur unique
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR56,2 %29ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. DenseOn se distingue sur les tâches de recherche d’information évaluées par BEIR, où il se place dans la partie haute du classement MTEB. Son architecture Sentence Transformer encode les requêtes et les documents séparément, avec les préfixes « query: » et « document: », puis exploite le jeton CLS pour le pooling. La comparaison par similarité cosinus facilite son intégration dans un moteur de recherche vectorielle. Ses vecteurs de 768 dimensions offrent une représentation exploitable pour l’indexation, tandis que la licence Apache 2.0 permet l’auto-hébergement et l’adaptation du modèle.

Limites et points d’attention. DenseOn cible l’anglais, ce qui restreint sa pertinence pour les corpus multilingues ou principalement francophones. La longueur maximale de 512 tokens impose aussi de découper les documents plus longs avant leur encodage. L’intégration doit respecter la distinction entre requêtes et documents ainsi que leurs préfixes respectifs afin de conserver le fonctionnement prévu. Usages pertinents : recherche sémantique anglophone, récupération de passages pour le RAG, détection de similarité et clustering de textes.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).