vidore/colqwen2.5-v0.2

Publié par vidore le 31 janvier 2025 sous licence ouverte Apache 2.0, vidore/colqwen2.5-v0.2 est un modèle d’embedding de 3 milliards de paramètres actifs. Issu de Qwen2.5-VL-3B, il produit pour le texte et les images des représentations multi-vecteurs de type ColBERT, avec des vecteurs…

Publié par vidore le 31 janvier 2025 sous licence ouverte Apache 2.0, vidore/colqwen2.5-v0.2 est un modèle d’embedding de 3 milliards de paramètres actifs. Issu de Qwen2.5-VL-3B, il produit pour le texte et les images des représentations multi-vecteurs de type ColBERT, avec des vecteurs de 128 dimensions.

Le modèle indexe principalement des documents PDF à partir de leur contenu visuel, puis compare une requête à ces représentations par un score multi-vecteur. Il convient à la recherche sémantique, à la récupération documentaire pour le RAG, à la mesure de similarité et au clustering. Son entraînement est entièrement anglophone et cible surtout les langues à fortes ressources.

Caractéristiques

CaractéristiqueValeur
TypeModèle d'embedding
Éditeurvidore
Poids🟢 Poids ouverts
LicenceApache 2.0
Date de sortie31 janvier 2025
Dimension du vecteur128
Représentationmulti-vecteur (ColBERT) pour texte et images
Paramètres3 milliards
Paramètres actifs3 milliards
Longueur de séquence max128 000 tokens
Modalités (entrée → sortie)image,text → embedding

Performances (benchmarks)

BenchmarkScoreRangSourceFiabilité
MTEB: ViDoRe (V1&V2)81,1 %26ᵉ / 48mteb✅ Mesuré
MTEB: Jina Visual Document Retrieval75,6 %2ᵉ / 5mteb✅ Mesuré
MTEB: ViDoRe V351,9 %21ᵉ / 39mteb✅ Mesuré

Scores issus de MTEB (Massive Text Embedding Benchmark), suite d'évaluation indépendante. Le rang situe le modèle parmi les modèles d'embedding évalués sur le même track.

Comment se situe-t-il ?

Le modèle (en orange) comparé aux meilleurs modèles sur chaque dimension évaluée, et à ses voisins de classement.

MTEB: ViDoRe (V1&V2)

▶ vidore/colqwen2.5-v0.281 %

MTEB: Jina Visual Document Retrieval

▶ vidore/colqwen2.5-v0.276 %

Notre analyse

Forces. vidore/colqwen2.5-v0.2 se distingue surtout en recherche visuelle de documents multilingues, variés par leur domaine et riches en mises en page, comme l’indique sa place parmi les meilleurs modèles du benchmark Jina Visual Document Retrieval. Son approche multi-vecteurs conserve des signaux fins issus du texte et de l’image, utiles pour retrouver des passages dans des PDF sans dépendre d’une extraction textuelle seule. Les images peuvent conserver leur ratio d’aspect grâce aux résolutions dynamiques, dans une limite de 768 patches. Les vecteurs de 128 dimensions restent compacts, tandis que la licence Apache 2.0 autorise l’auto-hébergement et l’intégration commerciale.

Limites et points d'attention. Les résultats sont plus intermédiaires sur ViDoRe V1&V2 et ViDoRe V3, notamment face à des documents multimodaux d’entreprise couvrant des domaines comme la finance. L’entraînement exclusivement en anglais limite la pertinence attendue pour les langues moins dotées. Le format ColBERT produit plusieurs vecteurs par document : malgré leur faible dimension, leur nombre peut alourdir l’index et rendre la recherche plus coûteuse qu’avec un embedding dense unique. Sorti il y a environ un an, le modèle est ancien à l’échelle de l’IA et probablement dépassé par des références plus récentes. Usages pertinents : recherche visuelle dans des PDF, RAG documentaire multimodal, similarité et clustering de documents à mise en page complexe.


Sources des données : MTEB — Massive Text Embedding Benchmark · LLM-Stats (llm-stats.com).