lightonai/ColBERT-Zero

Publié le 19 février 2026 par lightonai, lightonai/ColBERT-Zero est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 et applique une architecture ColBERT à interaction tardive avec…

Publié le 19 février 2026 par lightonai, lightonai/ColBERT-Zero est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 et applique une architecture ColBERT à interaction tardive avec l’opérateur MaxSim.

Le modèle sert à classer des documents par pertinence dans des moteurs de recherche sémantique et des pipelines RAG. Ses représentations peuvent aussi soutenir la mesure de similarité et le clustering. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes commerciaux.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie19 février 2026
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT à interaction tardive)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR55,4 %38ᵉ / 192mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. ColBERT-Zero obtient un bon niveau sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Son architecture conserve plusieurs vecteurs par texte, puis utilise MaxSim pour confronter finement les éléments d’une requête à ceux d’un document. L’entraînement associe préentraînement contrastif non supervisé, ajustement contrastif supervisé avec négatifs difficiles et distillation de connaissances, exclusivement à partir de données publiques. La dimension de 128 limite la taille de chaque vecteur, tandis que la licence Apache 2.0 facilite l’auto-hébergement et l’intégration.

Limites et points d’attention. Son classement sur BEIR le place à distance des tout premiers modèles du benchmark. La représentation multi-vecteur peut produire plusieurs embeddings par texte, ce qui alourdit potentiellement l’index et rend la recherche MaxSim plus coûteuse qu’une comparaison entre vecteurs uniques. L’intégration doit également respecter le format asymétrique prévu, avec les préfixes « search_query: » et « search_document: », ainsi que les marqueurs [Q] et [D]. Usages pertinents : recherche sémantique, sélection de passages pour le RAG, similarité documentaire et clustering.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).