lightonai/ColBERT-Zero
Publié le 19 février 2026 par lightonai, lightonai/ColBERT-Zero est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 et applique une architecture ColBERT à interaction tardive avec…
Publié le 19 février 2026 par lightonai, lightonai/ColBERT-Zero est un modèle d’embedding de 149 millions de paramètres, tous actifs. Fondé sur ModernBERT, il produit des représentations multi-vecteurs de dimension 128 et applique une architecture ColBERT à interaction tardive avec l’opérateur MaxSim.
Le modèle sert à classer des documents par pertinence dans des moteurs de recherche sémantique et des pipelines RAG. Ses représentations peuvent aussi soutenir la mesure de similarité et le clustering. Distribué sous licence ouverte Apache 2.0, il peut être auto-hébergé et intégré à des systèmes commerciaux.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | lightonai |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 19 février 2026 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur (ColBERT à interaction tardive) |
| Paramètres | 149 millions |
| Paramètres actifs | 149 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: BEIR | 55,4 % | 38ᵉ / 192 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: BEIR
Notre analyse
Forces. ColBERT-Zero obtient un bon niveau sur BEIR, qui évalue la recherche zero-shot dans des tâches et domaines hétérogènes. Son architecture conserve plusieurs vecteurs par texte, puis utilise MaxSim pour confronter finement les éléments d’une requête à ceux d’un document. L’entraînement associe préentraînement contrastif non supervisé, ajustement contrastif supervisé avec négatifs difficiles et distillation de connaissances, exclusivement à partir de données publiques. La dimension de 128 limite la taille de chaque vecteur, tandis que la licence Apache 2.0 facilite l’auto-hébergement et l’intégration.
Limites et points d’attention. Son classement sur BEIR le place à distance des tout premiers modèles du benchmark. La représentation multi-vecteur peut produire plusieurs embeddings par texte, ce qui alourdit potentiellement l’index et rend la recherche MaxSim plus coûteuse qu’une comparaison entre vecteurs uniques. L’intégration doit également respecter le format asymétrique prévu, avec les préfixes « search_query: » et « search_document: », ainsi que les marqueurs [Q] et [D]. Usages pertinents : recherche sémantique, sélection de passages pour le RAG, similarité documentaire et clustering.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).