ModernVBERT/colmodernvbert

ModernVBERT/colmodernvbert est un modèle d’embedding publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres produisent des représentations multi-vecteurs de dimension 128, selon une architecture ColBERT à interaction tardive.

ModernVBERT/colmodernvbert est un modèle d’embedding publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres produisent des représentations multi-vecteurs de dimension 128, selon une architecture ColBERT à interaction tardive.

Cet encodeur vision-langage est spécialisé dans la recherche de documents visuels. Il encode séparément la requête textuelle et l’image, puis calcule leur similarité. Cette approche convient à la recherche sémantique et au RAG sur des corpus visuels, ainsi qu’au regroupement de contenus à partir de leurs représentations numériques.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
ÉditeurModernVBERT
Poids🟢 Poids ouverts
LicenceMIT
Date de sortie1 octobre 2025
Dimension du vecteur128
Représentationmulti-vecteur à interaction tardive (ColBERT)
Paramètres252 millions
Paramètres actifs252 millions
Longueur de séquence max8 192 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe V326,1 %26ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. La spécialisation de ModernVBERT/colmodernvbert porte sur le retrieval de documents visuels, notamment au sein de corpus d’entreprise multimodaux évalués par ViDoRe V3 dans MTEB. L’interaction tardive permet de comparer finement les représentations d’une requête et d’une image sans les fusionner dès l’encodage. La dimension 128 limite la taille de chaque vecteur, même si l’approche multi-vecteur en conserve plusieurs par contenu. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Le modèle s’utilise avec colpali-engine, tandis que Flash Attention 2 est recommandé sur GPU.

Limites et points d’attention. Sur ViDoRe V3, le modèle se situe dans la partie basse du classement, ce qui invite à valider sa qualité sur le corpus visuel ciblé plutôt qu’à supposer une performance générale élevée. Son architecture multi-vecteur peut alourdir l’index et augmenter le coût de recherche par rapport à une représentation à vecteur unique, malgré la dimension compacte de 128. Il est spécialisé dans la mise en correspondance de requêtes textuelles et d’images, non dans la génération de réponses. Usages pertinents : recherche visuelle, RAG documentaire multimodal, similarité et clustering de documents visuels.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).