vidore

Récupération documentaire visuelle : les modèles ColPali et le benchmark ViDoRe

7 fiches modèlesorties 21 août 2024 → 3 novembre 20257 à poids ouvertscontexte jusqu'à 128 000 tokens

Vidore est l'organisation qui héberge les travaux autour de ColPali et du benchmark ViDoRe (Visual Document Retrieval), fruit d'un partenariat entre l'entreprise française Illuin Technology et le laboratoire MICS de CentraleSupélec, avec des contributions rattachées à Equall.ai et à l'ETH Zürich. Le projet a été formalisé dans l'article scientifique « ColPali: Efficient Document Retrieval with Vision Language Models » (2024), signé notamment par Manuel Faysse, Hugues Sibille, Tony Wu et Pierre Colombo.

Son offre au catalogue tient en modèles de récupération documentaire visuelle : ColPali (bâti sur PaliGemma) et ColQwen (bâti sur Qwen2-VL), qui produisent des représentations multi-vecteurs de style ColBERT à partir de l'image des pages, sans passer par une extraction de texte préalable. L'approche privilégie l'indexation directe des documents à partir de leurs caractéristiques visuelles, dans une logique de recherche ouverte et reproductible adossée à un benchmark public.

Ces modèles servent la recherche documentaire et les systèmes RAG appliqués à des documents riches (PDF, présentations, pages mêlant texte et figures), où la mise en page porte du sens.

Modèles

Modèles Embedding