vidore/colpali-v1.3
Publié par vidore le 1er novembre 2024, vidore/colpali-v1.3 est un modèle d’embedding de 3 milliards de paramètres, distribué sous licence ouverte Apache 2.0. Extension de PaliGemma-3B, il produit des représentations multi-vecteurs de style ColBERT pour le texte et les images, avec des…
Publié par vidore le 1er novembre 2024, vidore/colpali-v1.3 est un modèle d’embedding de 3 milliards de paramètres, distribué sous licence ouverte Apache 2.0. Extension de PaliGemma-3B, il produit des représentations multi-vecteurs de style ColBERT pour le texte et les images, avec des vecteurs de 128 dimensions.
Le modèle indexe notamment des documents PDF à partir de leur contenu textuel et de leur structure visuelle. Il sert à la recherche sémantique, à la récupération documentaire pour le RAG, à la similarité et au clustering. Son entraînement est conçu en anglais, avec un ciblage prioritaire des langues à hautes ressources.
Caractéristiques
| Caractéristique | Valeur |
|---|---|
| Type | Modèle d'embedding |
| Éditeur | vidore |
| Poids | 🟢 Poids ouverts |
| Licence | Apache 2.0 |
| Date de sortie | 1 novembre 2024 |
| Dimension du vecteur | 128 |
| Représentation | multi-vecteur de style ColBERT pour texte et images |
| Paramètres | 3 milliards |
| Paramètres actifs | 3 milliards |
| Longueur de séquence max | 16 384 tokens |
| Modalités (entrée → sortie) | image,text → embedding |
Performances (benchmarks)
| Benchmark | Score | Rang | Source | Fiabilité |
|---|---|---|---|---|
| MTEB: ViDoRe (V1&V2) | 76,2 % | 35ᵉ / 48 | mteb | ✅ Mesuré |
| MTEB: Jina Visual Document Retrieval | 66,1 % | 4ᵉ / 5 | mteb | ✅ Mesuré |
| MTEB: ViDoRe V3 | 43,1 % | 25ᵉ / 39 | mteb | ✅ Mesuré |
Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.
Comment se situe-t-il ?
Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.
MTEB: ViDoRe (V1&V2)
MTEB: Jina Visual Document Retrieval
Notre analyse
Forces. vidore/colpali-v1.3 est spécialisé dans la recherche au sein de documents visuels, multilingues, riches en mises en page et issus de domaines variés. Son résultat relatif le plus favorable apparaît sur Jina Visual Document Retrieval, consacré à ce type de corpus. Les interactions entre tokens textuels et patchs d’image permettent d’indexer directement les caractéristiques visuelles des pages, puis de comparer séparément images et requêtes avec un score multi-vecteur. La dimension de 128 reste compacte pour chaque vecteur, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’adaptation.
Limites et points d’attention. Les résultats sur ViDoRe V1&V2 et ViDoRe V3 placent le modèle dans la seconde moitié des classements, notamment face à des documents multimodaux d’entreprise couvrant des contenus financiers. Sa représentation multi-vecteur multiplie les vecteurs par document, ce qui peut alourdir l’index et rendre la recherche plus coûteuse malgré leur faible dimension individuelle. L’orientation vers l’anglais et les langues à hautes ressources limite aussi sa portée linguistique. Avec environ deux ans d’ancienneté, il appartient à une génération désormais ancienne à l’échelle de l’IA et peut être dépassé par des modèles plus récents. Usages pertinents : recherche visuelle dans des PDF, RAG documentaire multimodal, similarité et regroupement de pages.
Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).