vidore/colpali-v1.1

Publié par vidore le 21 août 2024 sous licence ouverte Apache 2.0, vidore/colpali-v1.1 est un modèle d’embedding de 3 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de dimension 128 pour le texte et les images, selon une approche inspirée de ColBERT.

Publié par vidore le 21 août 2024 sous licence ouverte Apache 2.0, vidore/colpali-v1.1 est un modèle d’embedding de 3 milliards de paramètres, tous actifs. Il produit des représentations multi-vecteurs de dimension 128 pour le texte et les images, selon une approche inspirée de ColBERT.

Extension de PaliGemma-3B, il indexe principalement des documents PDF à partir de leur contenu visuel. Entraîné entièrement en anglais et centré sur les langues à fortes ressources, il vise la recherche sémantique, la récupération de passages ou de pages pour le RAG, la mesure de similarité et le clustering documentaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie21 août 2024
Dimension du vecteur128
Représentationmulti-vecteur de style ColBERT pour le texte et les images
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max16 384 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)72,6 %39ᵉ / 48mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

Notre analyse

Forces. vidore/colpali-v1.1 rapproche directement les requêtes textuelles et les caractéristiques visuelles des documents. Les embeddings de patchs d’image issus de SigLIP sont projetés par PaliGemma-3B dans un espace latent comparable à celui du texte, puis associés par des interactions tardives de type ColBERT. Cette architecture convient à la recherche dans des PDF dont la mise en page, les tableaux ou les éléments graphiques portent une partie de l’information. La dimension 128 limite la taille de chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.

Limites et points d'attention. Sur ViDoRe (V1&V2), consacré à la recherche visuelle dans des documents variés, le modèle se situe dans le bas du classement, ce qui relativise sa compétitivité face aux autres systèmes évalués. Son entraînement intégralement anglophone et sa priorité donnée aux langues à fortes ressources réduisent son intérêt pour des corpus multilingues moins représentés. Le format multi-vecteur multiplie aussi les représentations par texte ou image, ce qui peut alourdir l’index et la recherche malgré la dimension 128. Avec environ deux ans d’ancienneté, il appartient à une génération désormais ancienne et probablement dépassée par des modèles plus récents. Usages pertinents : recherche sémantique et RAG sur des PDF visuels, similarité et clustering de documents principalement anglophones.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).