ViDoRe (V1&V2)

MTEB: ViDoRe (V1&V2) est un benchmark public de récupération de documents visuels, créé en 2024 par Illuin Technology, au sein de l’équipe ColPali. Il combine les tâches de ViDoRe v1 et v2 autour de documents visuellement riches.

MTEB: ViDoRe (V1&V2) est un benchmark public de récupération de documents visuels, créé en 2024 par Illuin Technology, au sein de l’équipe ColPali. Il combine les tâches de ViDoRe v1 et v2 autour de documents visuellement riches.

Il mesure la capacité des modèles à retrouver, à partir de requêtes, des pages pertinentes contenant du texte, des figures, des tableaux et des mises en page variées. Son périmètre multilingue et multidomaine permet de comparer les systèmes sur des contenus documentaires diversifiés.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkIlluin Technology (équipe ColPali)
Capacités mesuréesRécupération de documents visuels (texte, figures, tableaux, mises en page) à partir de requêtes, sur divers domaines et langues
Modalitéimage,text
Type de questionsrécupération de documents visuellement riches (visual document retrieval)
Métrique d'évaluationNDCG@10
AccèsPublic
Languesmultilingue (notamment anglais et français)
Taille du jeuViDoRe v1 (~127k pages PDF) + tâches v2, combinées
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (48)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DataScience-UIBK/Argus-Colqwen3.5-9b-v0DataScience-UIBK🟢 Ouvert86,0 %5 mai 2026✅ Mesuré
2DataScience-UIBK/Argus-Colqwen3.5-9b-v0-bf16DataScience-UIBK🟢 Ouvert85,9 %5 mai 2026✅ Mesuré
3vultr/VultronRetrieverPrime-Qwen3.5-8Bvultr🟢 Ouvert85,3 %18 juin 2026✅ Mesuré
4OpenSearch-AI/Ops-Colqwen3-4BOpenSearch-AI🟢 Ouvert84,9 %24 janvier 2026✅ Mesuré
5nvidia/nemotron-colembed-vl-8b-v2NVIDIA🟢 Ouvert84,8 %7 janvier 2026✅ Mesuré
6vultr/VultronRetrieverCore-Qwen3.5-4.5Bvultr🟢 Ouvert84,8 %22 juin 2026✅ Mesuré
7DataScience-UIBK/Argus-Colqwen3.5-4b-v0DataScience-UIBK🟢 Ouvert84,3 %29 avril 2026✅ Mesuré
8DataScience-UIBK/Argus-Colqwen3.5-4b-v0-bf16DataScience-UIBK🟢 Ouvert84,2 %3 mai 2026✅ Mesuré
9webAI-Official/webAI-ColVec1-9bwebAI-Official🟢 Ouvert84,0 %5 avril 2026✅ Mesuré
10nvidia/nemotron-colembed-vl-4b-v2NVIDIA🟢 Ouvert83,9 %7 janvier 2026✅ Mesuré
11athrael-soju/colqwen3.5-4.5B-v3athrael-soju🟢 Ouvert83,7 %15 mars 2026✅ Mesuré
12nvidia/llama-nemotron-colembed-vl-3b-v2NVIDIA🟢 Ouvert83,6 %21 janvier 2026✅ Mesuré
13TomoroAI/tomoro-colqwen3-embed-8bTomoroAI🟢 Ouvert83,5 %26 novembre 2025✅ Mesuré
14ApsaraStackMaaS/EvoQwen2.5-VL-Retriever-7B-v1ApsaraStackMaaS🟢 Ouvert83,4 %4 novembre 2025✅ Mesuré
15TomoroAI/tomoro-colqwen3-embed-4bTomoroAI🟢 Ouvert83,2 %26 novembre 2025✅ Mesuré
16nvidia/llama-nemoretriever-colembed-3b-v1NVIDIA🟢 Ouvert83,1 %27 juin 2025✅ Mesuré
17DataScience-UIBK/Argus-Colqwen3.5-2b-v0DataScience-UIBK🟢 Ouvert83,0 %3 mai 2026✅ Mesuré
18DataScience-UIBK/Argus-Colqwen3.5-2b-v0-bf16DataScience-UIBK🟢 Ouvert83,0 %3 mai 2026✅ Mesuré
19VAGOsolutions/SauerkrautLM-ColQwen3-8b-v0.1VAGOsolutions🟢 Ouvert82,9 %20 décembre 2025✅ Mesuré
20webAI-Official/webAI-ColVec1-4bwebAI-Official🟢 Ouvert82,8 %5 avril 2026✅ Mesuré
21ApsaraStackMaaS/EvoQwen2.5-VL-Retriever-3B-v1ApsaraStackMaaS🟢 Ouvert82,8 %4 novembre 2025✅ Mesuré
22nvidia/llama-nemoretriever-colembed-1b-v1NVIDIA🟢 Ouvert82,6 %27 juin 2025✅ Mesuré
23VAGOsolutions/SauerkrautLM-ColQwen3-4b-v0.1VAGOsolutions🟢 Ouvert82,0 %20 décembre 2025✅ Mesuré
24nomic-ai/colnomic-embed-multimodal-7bNomic AI🟢 Ouvert81,3 %31 mars 2025✅ Mesuré
25jinaai/jina-embeddings-v4Jina AI🟢 Ouvert81,2 %24 juin 2025✅ Mesuré
26vidore/colqwen2.5-v0.2vidore🟢 Ouvert81,1 %31 janvier 2025✅ Mesuré
27VAGOsolutions/SauerkrautLM-ColQwen3-2b-v0.1VAGOsolutions🟢 Ouvert81,0 %20 décembre 2025✅ Mesuré
28vultr/VultronRetrieverFlash-Qwen3.5-0.8Bvultr🟢 Ouvert80,2 %21 juin 2026✅ Mesuré
29nomic-ai/colnomic-embed-multimodal-3bNomic AI🟢 Ouvert80,1 %31 mars 2025✅ Mesuré
30vidore/colqwen2-v1.0vidore🟢 Ouvert79,7 %3 novembre 2025✅ Mesuré
31VAGOsolutions/SauerkrautLM-ColQwen3-1.7b-Turbo-v0.1VAGOsolutions🟢 Ouvert77,9 %20 décembre 2025✅ Mesuré
32ibm-granite/granite-vision-3.3-2b-embeddingIBM🟢 Ouvert77,7 %11 juin 2025✅ Mesuré
33eagerworks/eager-embed-v1eagerworks🟢 Ouvert77,0 %20 novembre 2025✅ Mesuré
34nanovdr/NanoVDR-S-Multinanovdr🟢 Ouvert76,5 %26 février 2026✅ Mesuré
35vidore/colpali-v1.3vidore🟢 Ouvert76,2 %1 novembre 2024✅ Mesuré
36voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert75,7 %10 novembre 2024✅ Mesuré
37vidore/colpali-v1.2vidore🟢 Ouvert74,3 %26 août 2024✅ Mesuré
38VAGOsolutions/SauerkrautLM-ColLFM2-450M-v0.1VAGOsolutions🟢 Ouvert74,3 %20 décembre 2025✅ Mesuré
39vidore/colpali-v1.1vidore🟢 Ouvert72,6 %21 août 2024✅ Mesuré
40VAGOsolutions/SauerkrautLM-ColMinistral3-3b-v0.1VAGOsolutions🟢 Ouvert71,9 %20 décembre 2025✅ Mesuré
41vidore/colSmol-500Mvidore🟢 Ouvert71,2 %22 janvier 2025✅ Mesuré
42vidore/colSmol-256Mvidore🟢 Ouvert66,9 %22 janvier 2025✅ Mesuré
43royokong/e5-vroyokong🟢 Ouvert58,1 %17 juillet 2024✅ Mesuré
44google/siglip-so400m-patch14-384Google🟢 Ouvert49,7 %8 janvier 2024✅ Mesuré
45TIGER-Lab/VLM2Vec-FullTIGER-Lab🟢 Ouvert44,7 %8 octobre 2024✅ Mesuré
46laion/CLIP-ViT-bigG-14-laion2B-39B-b160klaion🟢 Ouvert36,4 %23 janvier 2023✅ Mesuré
47openai/clip-vit-base-patch16OpenAI🟢 Ouvert21,4 %26 février 2021✅ Mesuré
48jinaai/jina-clip-v1Jina AI🟢 Ouvert15,4 %30 mai 2024✅ Mesuré

Classement établi sur 48 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 81,2 %.

Notre analyse

Un score NDCG@10 élevé indique que le modèle place fréquemment les documents pertinents parmi ses dix premiers résultats, avec une meilleure valorisation des réponses correctement ordonnées en tête de liste. Le classement montre un niveau global élevé parmi les 48 modèles recensés, avec seulement cinq points entre le score médian et le meilleur résultat. DataScience-UIBK/Argus-Colqwen3.5-9b-v0 occupe la première place, ce qui signale une performance particulièrement forte sur l’ensemble combiné des tâches ViDoRe. Cette proximité au sommet peut toutefois réduire le pouvoir discriminant du benchmark et évoquer un début de saturation. La rigueur comparative doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant commun. L’accès public facilite l’évaluation reproductible, mais crée également un risque d’adaptation aux tâches ou de contamination. Enfin, la portée reste ciblée sur la récupération de documents visuellement riches, dans les domaines et langues couverts, notamment l’anglais et le français.


Sources des scores : mteb.