lightonai/GTE-ModernColBERT-v1

Publié le 30 avril 2025 par lightonai, GTE-ModernColBERT-v1 est un modèle d’embedding anglophone de 149 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur gte-modernbert-base, il associe ModernBERT à une architecture ColBERT et produit, pour chaque texte, une séquence de…

Publié le 30 avril 2025 par lightonai, GTE-ModernColBERT-v1 est un modèle d’embedding anglophone de 149 millions de paramètres, sous licence ouverte Apache 2.0. Fondé sur gte-modernbert-base, il associe ModernBERT à une architecture ColBERT et produit, pour chaque texte, une séquence de vecteurs denses de 128 dimensions.

Le modèle encode séparément requêtes et documents, puis mesure leur similarité sémantique avec l’opérateur MaxSim. Cette représentation multi-vecteur vise la recherche sémantique, le reranking et la récupération de passages pour le RAG. Elle peut aussi alimenter des traitements de similarité et de clustering, notamment avec un index Voyager HNSW.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurlightonai
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie30 avril 2025
Dimension du vecteur128
Représentationmulti-vecteur ColBERT dense (séquences de vecteurs denses 128 dimensions)
Paramètres149 millions
Paramètres actifs149 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: BEIR54,8 %46ᵉ / 192mteb✅ Mesuré
MTEB: Long-context Retrieval90,6 %2ᵉ / 170mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: BEIR

▶ lightonai/GTE-ModernCol…55 %
WhereIsAI/UAE-Large-V155 %

MTEB: Long-context Retrieval

▶ lightonai/GTE-ModernCol…91 %

Notre analyse

Forces. GTE-ModernColBERT-v1 se distingue surtout en Long-context Retrieval, où il figure parmi les meilleurs modèles évalués par MTEB. Ce résultat indique une forte aptitude à retrouver des informations dans des contenus longs, sur des tâches synthétiques comme réelles. L’architecture ColBERT conserve plusieurs représentations par texte et MaxSim permet d’établir des correspondances fines entre les éléments d’une requête et ceux d’un document. Les vecteurs de 128 dimensions restent compacts individuellement, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration dans des systèmes commerciaux.

Limites et points d'attention. Les résultats sur BEIR sont nettement moins distinctifs que ceux obtenus en contexte long, ce qui suggère une qualité plus ordinaire sur un ensemble hétérogène de tâches et de domaines en zero-shot retrieval. Le modèle est indiqué pour l’anglais et son entraînement repose sur ms-marco-en-bge-gemma. Sa représentation multi-vecteur peut aussi produire plusieurs vecteurs par document, ce qui alourdit l’index et la recherche malgré leur dimension réduite. Âgé d’environ un an, il appartient déjà à une génération ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche anglophone en contexte long, reranking et récupération de passages pour le RAG.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).