lightonai/ColBERT-Zero-unsupervised
Publié par lightonai le 19 février 2026 sous licence ouverte Apache 2.0, lightonai/ColBERT-Zero-unsupervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit une représentation ColBERT multi-vecteur dont chaque vecteur compte 128…
Publié par lightonai le 19 février 2026 sous licence ouverte Apache 2.0, lightonai/ColBERT-Zero-unsupervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit une représentation ColBERT multi-vecteur dont chaque vecteur compte 128 dimensions.
Le modèle repose sur une interaction tardive entre les représentations des tokens. Pré-entraîné par apprentissage contrastif non supervisé sur le jeu public nomic-embed-unsupervised-data, il apprend dès cette phase l’importance fine des tokens. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering, sans générer de texte.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 19 février 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur (ColBERT) |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 51,3 % | 87ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. L’architecture ColBERT conserve des représentations distinctes au niveau des tokens, ce qui permet une comparaison fine entre une requête et les passages indexés. Cet objectif multi-vecteur est appris dès le pré-entraînement contrastif non supervisé. Sur BEIR, qui couvre des tâches de recherche zero-shot dans des domaines et scénarios hétérogènes, le modèle atteint un niveau intermédiaire. Les vecteurs de 128 dimensions restent compacts à l’échelle de chaque token. La licence Apache 2.0 autorise par ailleurs l’intégration, la modification et l’auto-hébergement du modèle.
Limites et points d'attention. Le classement obtenu sur BEIR place le modèle loin des premières positions, ce qui invite à valider sa qualité sur les corpus et requêtes visés avant un déploiement. La représentation multi-vecteur implique de conserver plusieurs vecteurs par texte, contrairement à un embedding à vecteur unique. Malgré une dimension unitaire de 128, cette granularité peut donc alourdir l’index et rendre la recherche plus coûteuse en stockage et en calcul. Usages pertinents : recherche sémantique à granularité fine, récupération de passages pour le RAG, similarité documentaire et clustering lorsque l’interaction entre tokens justifie ce surcoût.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).