lightonai/DenseOn-unsupervised
Publié par lightonai le 21 avril 2026 sous licence ouverte Apache 2.0, DenseOn-unsupervised est un modèle d’embedding anglophone de 149 millions de paramètres. Fondé sur ModernBERT-base, il accepte jusqu’à 512 tokens et représente chaque texte par un unique vecteur dense de 768…
Publié par lightonai le 21 avril 2026 sous licence ouverte Apache 2.0, DenseOn-unsupervised est un modèle d’embedding anglophone de 149 millions de paramètres. Fondé sur ModernBERT-base, il accepte jusqu’à 512 tokens et représente chaque texte par un unique vecteur dense de 768 dimensions, obtenu par pooling sur le token CLS.
Le modèle fournit des encodages distincts pour les requêtes et les documents, comparés par similarité cosinus. Il sert à la recherche sémantique, à la première étape d’un pipeline RAG, au calcul de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 21 avril 2026 |
| Dimension du vecteur | 768 |
| Représentation | dense à vecteur unique |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 49,1 % | 109ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. DenseOn-unsupervised repose sur un pré-entraînement contrastif non supervisé appliqué à des paires requête-document filtrées, une conception directement adaptée au retrieval. La séparation des encodages de requêtes et de documents facilite son emploi dans un moteur de recherche vectorielle. Sa licence Apache 2.0 autorise l’auto-hébergement et l’adaptation, tandis que le checkpoint vise notamment l’ajustement supervisé, la distillation et les expérimentations sur des données propres à un domaine. Sa fenêtre de 512 tokens permet d’encoder des passages de longueur modérée.
Limites et points d'attention. Sur BEIR, qui mesure la qualité de recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe dans la seconde moitié du classement avec 49 % et le rang 109 sur 192. Il correspond uniquement à la première étape du pipeline DenseOn et n’a pas reçu d’ajustement fondé sur des négatifs difficiles minés. Son orientation anglophone restreint les usages multilingues, et la limite de 512 tokens impose de segmenter les documents plus longs. Les vecteurs de 768 dimensions entraînent aussi un stockage et des calculs de similarité proportionnels à cette taille. Usages pertinents : recherche sémantique anglophone, indexation pour RAG, similarité, clustering et base d’une adaptation spécialisée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).