lightonai/LateOn-unsupervised
Publié par lightonai le 21 avril 2026, LateOn-unsupervised est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il produit des représentations multi-vecteurs ColBERT de dimension 128 et compare requêtes et documents par similarité…
Publié par lightonai le 21 avril 2026, LateOn-unsupervised est un modèle d’embedding anglophone de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT-base, il produit des représentations multi-vecteurs ColBERT de dimension 128 et compare requêtes et documents par similarité MaxSim. Il est distribué sous licence ouverte Apache 2.0.
Le modèle sert à la recherche sémantique, à la récupération de passages pour les systèmes RAG, au reranking, à la mesure de similarité et au clustering. PyLate permet son utilisation pour l’indexation et la recherche avec PLAID. Il transforme le texte en vecteurs et ne génère pas de réponses textuelles.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 21 avril 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur (ColBERT) |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 50,1 % | 99ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. LateOn-unsupervised cible directement le retrieval grâce à son architecture ColBERT, qui conserve plusieurs représentations par texte et applique MaxSim pour rapprocher finement les termes d’une requête et ceux d’un document. Ses vecteurs de dimension 128 limitent la taille de chaque représentation, un avantage pour l’indexation par rapport à des vecteurs individuels plus larges. La licence Apache 2.0 facilite l’auto-hébergement, la modification et l’intégration dans des applications. Le modèle constitue aussi un point de départ pour l’adaptation, la distillation ou l’ajustement supervisé.
Limites et points d'attention. Sur BEIR, qui mesure la qualité de recherche zero-shot dans des tâches et domaines hétérogènes, le modèle se situe au milieu du classement plutôt que parmi les références dominantes. Son entraînement correspond seulement à la première étape de LateOn : un pré-entraînement contrastif non supervisé sur des paires requête-document filtrées, sans ajustement à partir de négatifs difficiles extraits. Son fonctionnement anglophone restreint son intérêt pour les corpus multilingues. Malgré la dimension 128, la représentation multi-vecteur peut produire des index plus volumineux et une recherche plus coûteuse qu’un embedding à vecteur unique. Usages pertinents : recherche sémantique anglophone, récupération pour RAG, reranking, similarité, clustering et base d’une adaptation spécialisée.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).