lightonai/ColBERT-Zero-supervised

Publié par lightonai le 19 février 2026, lightonai/ColBERT-Zero-supervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 selon l’architecture ColBERT à interaction tardive.

Publié par lightonai le 19 février 2026, lightonai/ColBERT-Zero-supervised est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 selon l’architecture ColBERT à interaction tardive.

Distribué sous licence ouverte Apache 2.0, il est destiné à la recherche sémantique, à la récupération de passages pour le RAG, à la mesure de similarité et au clustering. Il s’appuie sur des invites distinctes pour les requêtes et les documents afin d’adapter leur représentation à leur rôle dans la recherche.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie19 février 2026
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT à interaction tardive)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR51,9 %75ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

llmrails/ember-v152 %
▶ lightonai/ColBERT-Zero-…52 %

Notre analyse

Forces. ColBERT-Zero-supervised est spécialisé dans le retrieval grâce à une interaction tardive entre les vecteurs des termes de la requête et ceux des documents. Son résultat sur BEIR le place dans la première moitié des modèles évalués pour la recherche zero-shot sur des tâches et domaines hétérogènes. L’entraînement contrastif a lieu directement dans l’espace multi-vecteur, sur des données publiques issues de la mixture Nomic-embed. La phase supervisée intègre des négatifs difficiles extraits, utiles pour apprendre à distinguer des passages proches mais non pertinents. La licence Apache 2.0 autorise l’auto-hébergement et l’adaptation du modèle.

Limites et points d’attention. Il s’agit d’un point de contrôle intermédiaire de ColBERT-Zero, et non de son aboutissement final. Malgré une dimension de 128, la représentation multi-vecteur conserve plusieurs vecteurs par texte, ce qui peut alourdir l’index et rendre la recherche plus coûteuse qu’avec un embedding à vecteur unique. L’intégration doit aussi respecter les invites « search_query: » et « search_document: », ainsi que les marqueurs [Q] et [D], afin de préserver l’asymétrie entre requêtes et documents. Usages pertinents : moteurs de recherche sémantique, récupération de passages pour le RAG, similarité et clustering fondés sur des représentations multi-vecteurs.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).