vidore/colpali-v1.2

Publié par vidore le 26 août 2024, vidore/colpali-v1.2 est un modèle d’embedding ouvert sous licence Apache 2.0. Cette extension de PaliGemma-3B compte 3 milliards de paramètres actifs et produit des représentations multi-vecteurs de type ColBERT, avec des vecteurs de 128 dimensions pour…

Publié par vidore le 26 août 2024, vidore/colpali-v1.2 est un modèle d’embedding ouvert sous licence Apache 2.0. Cette extension de PaliGemma-3B compte 3 milliards de paramètres actifs et produit des représentations multi-vecteurs de type ColBERT, avec des vecteurs de 128 dimensions pour le texte et les images.

Le modèle indexe principalement des documents PDF à partir de leurs caractéristiques visuelles. Entraîné entièrement en anglais, il cible les langues à fortes ressources et peut être évalué en généralisation zero-shot dans d’autres langues. Ses représentations servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering documentaire.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie26 août 2024
Dimension du vecteur128
Représentationmulti-vecteur de type ColBERT pour le texte et les images
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max16 384 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)74,3 %37ᵉ / 48mteb✅ Mesuré
MTEB: Jina Visual Document Retrieval64,4 %5ᵉ / 5mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ vidore/colpali-v1.274 %

MTEB: Jina Visual Document Retrieval

▶ vidore/colpali-v1.264 %

Notre analyse

Forces. ColPali-v1.2 est spécialisé dans la recherche visuelle au sein de documents aux mises en page riches et issus de domaines variés. Les interactions tardives entre tokens textuels et patchs d’image permettent de comparer directement une requête avec les éléments visuels d’une page, sans réduire le document à son seul texte extrait. Les évaluations ViDoRe et Jina Visual Document Retrieval confirment son orientation vers le retrieval de documents visuels, y compris dans des contextes multilingues et multi-domaines. La dimension de sortie de 128 reste compacte, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.

Limites et points d'attention. Son classement sur ViDoRe le place dans la partie basse des modèles évalués, et il arrive dernier sur Jina Visual Document Retrieval malgré son appartenance au top 10 de ce benchmark. Son entraînement exclusivement anglophone rend les performances dans les autres langues dépendantes d’une généralisation zero-shot. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents. Ses 3 milliards de paramètres imposent aussi davantage de ressources qu’un petit encodeur. Usages pertinents : recherche sémantique et RAG sur des PDF visuels, similarité de pages et clustering documentaire.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).