lightonai/ColBERT-Zero-unsupervised

Publié par lightonai le 19 février 2026 sous licence ouverte Apache 2.0, lightonai/ColBERT-Zero-unsupervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit une représentation ColBERT multi-vecteur dont chaque vecteur compte 128…

Publié par lightonai le 19 février 2026 sous licence ouverte Apache 2.0, lightonai/ColBERT-Zero-unsupervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit une représentation ColBERT multi-vecteur dont chaque vecteur compte 128 dimensions.

Le modèle repose sur une interaction tardive entre les représentations des tokens. Pré-entraîné par apprentissage contrastif non supervisé sur le jeu public nomic-embed-unsupervised-data, il apprend dès cette phase l’importance fine des tokens. Il sert à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering, sans générer de texte.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie19 février 2026
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,3 %87ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. L’architecture ColBERT conserve des représentations distinctes au niveau des tokens, ce qui permet une comparaison fine entre une requête et les passages indexés. Cet objectif multi-vecteur est appris dès le pré-entraînement contrastif non supervisé. Sur BEIR, qui couvre des tâches de recherche zero-shot dans des domaines et scénarios hétérogènes, le modèle atteint un niveau intermédiaire. Les vecteurs de 128 dimensions restent compacts à l’échelle de chaque token. La licence Apache 2.0 autorise par ailleurs l’intégration, la modification et l’auto-hébergement du modèle.

Limites et points d'attention. Le classement obtenu sur BEIR place le modèle loin des premières positions, ce qui invite à valider sa qualité sur les corpus et requêtes visés avant un déploiement. La représentation multi-vecteur implique de conserver plusieurs vecteurs par texte, contrairement à un embedding à vecteur unique. Malgré une dimension unitaire de 128, cette granularité peut donc alourdir l’index et rendre la recherche plus coûteuse en stockage et en calcul. Usages pertinents : recherche sémantique à granularité fine, récupération de passages pour le RAG, similarité documentaire et clustering lorsque l’interaction entre tokens justifie ce surcoût.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).