vidore/colpali-v1.2
Publié par vidore le 26 août 2024, vidore/colpali-v1.2 est un modèle d’embedding ouvert sous licence Apache 2.0. Cette extension de PaliGemma-3B compte 3 milliards de paramètres actifs et produit des représentations multi-vecteurs de type ColBERT, avec des vecteurs de 128 dimensions pour…
Publié par vidore le 26 août 2024, vidore/colpali-v1.2 est un modèle d’embedding ouvert sous licence Apache 2.0. Cette extension de PaliGemma-3B compte 3 milliards de paramètres actifs et produit des représentations multi-vecteurs de type ColBERT, avec des vecteurs de 128 dimensions pour le texte et les images.
Le modèle indexe principalement des documents PDF à partir de leurs caractéristiques visuelles. Entraîné entièrement en anglais, il cible les langues à fortes ressources et peut être évalué en généralisation zero-shot dans d’autres langues. Ses représentations servent à la recherche sémantique, au RAG, à la mesure de similarité et au clustering documentaire.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | vidore |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 26 août 2024 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur de type ColBERT pour le texte et les images |
| Paramètres | 3 milliards |
| Paramètres actifs | 3 milliards |
| Longueur de séquence max | 16 384 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 74,3 % | 37ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Jina Visual Document Retrieval | 64,4 % | 5ᵉ / 5 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: Jina Visual Document Retrieval
Notre analyse
Forces. ColPali-v1.2 est spécialisé dans la recherche visuelle au sein de documents aux mises en page riches et issus de domaines variés. Les interactions tardives entre tokens textuels et patchs d’image permettent de comparer directement une requête avec les éléments visuels d’une page, sans réduire le document à son seul texte extrait. Les évaluations ViDoRe et Jina Visual Document Retrieval confirment son orientation vers le retrieval de documents visuels, y compris dans des contextes multilingues et multi-domaines. La dimension de sortie de 128 reste compacte, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.
Limites et points d'attention. Son classement sur ViDoRe le place dans la partie basse des modèles évalués, et il arrive dernier sur Jina Visual Document Retrieval malgré son appartenance au top 10 de ce benchmark. Son entraînement exclusivement anglophone rend les performances dans les autres langues dépendantes d’une généralisation zero-shot. Avec environ deux ans d’ancienneté, durée très longue à l’échelle de l’IA, il appartient à une génération probablement dépassée par des modèles plus récents. Ses 3 milliards de paramètres imposent aussi davantage de ressources qu’un petit encodeur. Usages pertinents : recherche sémantique et RAG sur des PDF visuels, similarité de pages et clustering documentaire.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).