vidore/colpali-v1.3

Publié par vidore le 1er novembre 2024, vidore/colpali-v1.3 est un modèle d’embedding de 3 milliards de paramètres, distribué sous licence ouverte Apache 2.0. Extension de PaliGemma-3B, il produit des représentations multi-vecteurs de style ColBERT pour le texte et les images, avec des…

Publié par vidore le 1er novembre 2024, vidore/colpali-v1.3 est un modèle d’embedding de 3 milliards de paramètres, distribué sous licence ouverte Apache 2.0. Extension de PaliGemma-3B, il produit des représentations multi-vecteurs de style ColBERT pour le texte et les images, avec des vecteurs de 128 dimensions.

Le modèle indexe notamment des documents PDF à partir de leur contenu textuel et de leur structure visuelle. Il sert à la recherche sémantique, à la récupération documentaire pour le RAG, à la similarité et au clustering. Son entraînement est conçu en anglais, avec un ciblage prioritaire des langues à hautes ressources.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie1 novembre 2024
Dimension du vecteur128
Représentationmulti-vecteur de style ColBERT pour texte et images
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max16 384 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)76,2 %35ᵉ / 48mteb✅ Mesuré
MTEB: Jina Visual Document Retrieval66,1 %4ᵉ / 5mteb✅ Mesuré
MTEB: ViDoRe V343,1 %25ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

nanovdr/NanoVDR-S-Multi77 %
▶ vidore/colpali-v1.376 %

MTEB: Jina Visual Document Retrieval

▶ vidore/colpali-v1.366 %

Notre analyse

Forces. vidore/colpali-v1.3 est spécialisé dans la recherche au sein de documents visuels, multilingues, riches en mises en page et issus de domaines variés. Son résultat relatif le plus favorable apparaît sur Jina Visual Document Retrieval, consacré à ce type de corpus. Les interactions entre tokens textuels et patchs d’image permettent d’indexer directement les caractéristiques visuelles des pages, puis de comparer séparément images et requêtes avec un score multi-vecteur. La dimension de 128 reste compacte pour chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.

Limites et points d’attention. Les résultats sur ViDoRe V1&V2 et ViDoRe V3 placent le modèle dans la seconde moitié des classements, notamment face à des documents multimodaux d’entreprise couvrant des contenus financiers. Sa représentation multi-vecteur multiplie les vecteurs par document, ce qui peut alourdir l’index et rendre la recherche plus coûteuse malgré leur faible dimension individuelle. L’orientation vers l’anglais et les langues à hautes ressources limite aussi sa portée linguistique. Avec environ deux ans d’ancienneté, il appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche visuelle dans des PDF, RAG documentaire multimodal, similarité et regroupement de pages.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).