ModernVBERT/colmodernvbert
ModernVBERT/colmodernvbert est un modèle d’embedding publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres produisent des représentations multi-vecteurs de dimension 128, selon une architecture ColBERT à interaction tardive.
ModernVBERT/colmodernvbert est un modèle d’embedding publié par ModernVBERT le 1er octobre 2025 sous licence ouverte MIT. Ses 252 millions de paramètres produisent des représentations multi-vecteurs de dimension 128, selon une architecture ColBERT à interaction tardive.
Cet encodeur vision-langage est spécialisé dans la recherche de documents visuels. Il encode séparément la requête textuelle et l’image, puis calcule leur similarité. Cette approche convient à la recherche sémantique et au RAG sur des corpus visuels, ainsi qu’au regroupement de contenus à partir de leurs représentations numériques.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | ModernVBERT |
| Poids | 🟢 Poids ouverts |
| Licence | MIT |
| Date de sortie | 1 octobre 2025 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur à interaction tardive (ColBERT) |
| Paramètres | 252 millions |
| Paramètres actifs | 252 millions |
| Longueur de séquence max | 8 192 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe V3 | 26,1 % | 26ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe V3
Notre analyse
Forces. La spécialisation de ModernVBERT/colmodernvbert porte sur le retrieval de documents visuels, notamment au sein de corpus d’entreprise multimodaux évalués par ViDoRe V3 dans MTEB. L’interaction tardive permet de comparer finement les représentations d’une requête et d’une image sans les fusionner dès l’encodage. La dimension 128 limite la taille de chaque vecteur, même si l’approche multi-vecteur en conserve plusieurs par contenu. La licence MIT facilite l’intégration, la modification et l’auto-hébergement. Le modèle s’utilise avec colpali-engine, tandis que Flash Attention 2 est recommandé sur GPU.
Limites et points d’attention. Sur ViDoRe V3, le modèle se situe dans la partie basse du classement, ce qui invite à valider sa qualité sur le corpus visuel ciblé plutôt qu’à supposer une performance générale élevée. Son architecture multi-vecteur peut alourdir l’index et augmenter le coût de recherche par rapport à une représentation à vecteur unique, malgré la dimension compacte de 128. Il est spécialisé dans la mise en correspondance de requêtes textuelles et d’images, non dans la génération de réponses. Usages pertinents : recherche visuelle, RAG documentaire multimodal, similarité et clustering de documents visuels.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).