ViDoRe V3

MTEB: ViDoRe V3 est un benchmark conçu par ILLUIN Technology avec NVIDIA pour évaluer la récupération multilingue de documents visuels complexes. Il couvre des contenus d’entreprise multimodaux issus notamment de la finance, de l’industrie, de l’informatique et du secteur pharmaceutique.

MTEB: ViDoRe V3 est un benchmark conçu par ILLUIN Technology avec NVIDIA pour évaluer la récupération multilingue de documents visuels complexes. Il couvre des contenus d’entreprise multimodaux issus notamment de la finance, de l’industrie, de l’informatique et du secteur pharmaceutique.

Publié en 2025, il mesure la capacité des modèles à retrouver des pages pertinentes et à soutenir des systèmes de RAG multimodal. Son cadre commun facilite la comparaison des modèles sur des tâches représentatives de la recherche d’information dans des environnements professionnels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkILLUIN Technology (avec NVIDIA)
Capacités mesuréesRécupération de documents visuels multilingue sur documents d'entreprise complexes (finance, industrie, informatique, pharma, etc.), RAG multimodal
Modalitéimage,text
Type de questionsrécupération de documents visuels / RAG multimodal d'entreprise
Métrique d'évaluationNDCG@10
AccèsPublic
Langues6 langues (anglais, français, espagnol, allemand, italien, portugais)
Taille du jeu26 000 pages, 3 099 requêtes (10 jeux de données)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (39)

#ModèleÉditeurLicenceScoreSortieFiabilité
1vultr/VultronRetrieverPrime-Qwen3.5-8Bvultr🟢 Ouvert64,3 %18 juin 2026✅ Mesuré
2vultr/VultronRetrieverCore-Qwen3.5-4.5Bvultr🟢 Ouvert63,6 %22 juin 2026✅ Mesuré
3nvidia/nemotron-colembed-vl-8b-v2NVIDIA🟢 Ouvert63,4 %7 janvier 2026✅ Mesuré
4webAI-Official/webAI-ColVec1-9bwebAI-Official🟢 Ouvert63,0 %5 avril 2026✅ Mesuré
5webAI-Official/webAI-ColVec1-4bwebAI-Official🟢 Ouvert62,2 %5 avril 2026✅ Mesuré
6TomoroAI/tomoro-colqwen3-embed-8bTomoroAI🟢 Ouvert61,6 %26 novembre 2025✅ Mesuré
7nvidia/nemotron-colembed-vl-4b-v2NVIDIA🟢 Ouvert61,5 %7 janvier 2026✅ Mesuré
8athrael-soju/colqwen3.5-4.5B-v3athrael-soju🟢 Ouvert61,5 %15 mars 2026✅ Mesuré
9OpenSearch-AI/Ops-Colqwen3-4BOpenSearch-AI🟢 Ouvert61,2 %24 janvier 2026✅ Mesuré
10TomoroAI/tomoro-colqwen3-embed-4bTomoroAI🟢 Ouvert60,2 %26 novembre 2025✅ Mesuré
11nvidia/llama-nemotron-colembed-vl-3b-v2NVIDIA🟢 Ouvert59,8 %21 janvier 2026✅ Mesuré
12Qwen/Qwen3-VL-Embedding-8BAlibaba Cloud / Qwen Team🟢 Ouvert57,8 %8 janvier 2026✅ Mesuré
13jinaai/jina-embeddings-v4Jina AI🟢 Ouvert57,5 %24 juin 2025✅ Mesuré
14nomic-ai/colnomic-embed-multimodal-7bNomic AI🟢 Ouvert57,3 %31 mars 2025✅ Mesuré
15nvidia/llama-nemoretriever-colembed-3b-v1NVIDIA🟢 Ouvert57,3 %27 juin 2025✅ Mesuré
16vultr/VultronRetrieverFlash-Qwen3.5-0.8Bvultr🟢 Ouvert56,2 %21 juin 2026✅ Mesuré
17Verm1ion/ColTurk-VDR-Qwen3VL-4B-v1.0Verm1ion🟢 Ouvert55,8 %11 juin 2026✅ Mesuré
18nomic-ai/colnomic-embed-multimodal-3bNomic AI🟢 Ouvert55,8 %31 mars 2025✅ Mesuré
19nvidia/llama-nemoretriever-colembed-1b-v1NVIDIA🟢 Ouvert55,6 %27 juin 2025✅ Mesuré
20Qwen/Qwen3-VL-Embedding-2BAlibaba Cloud / Qwen Team🟢 Ouvert52,6 %8 janvier 2026✅ Mesuré
21vidore/colqwen2.5-v0.2vidore🟢 Ouvert51,9 %31 janvier 2025✅ Mesuré
22jinaai/jina-embeddings-v5-omni-smallJina AI🟢 Ouvert45,6 %1 avril 2026✅ Mesuré
23jinaai/jina-embeddings-v5-omni-nanoJina AI🟢 Ouvert45,6 %1 avril 2026✅ Mesuré
24vidore/colqwen2-v1.0vidore🟢 Ouvert44,7 %3 novembre 2025✅ Mesuré
25vidore/colpali-v1.3vidore🟢 Ouvert43,1 %1 novembre 2024✅ Mesuré
26ModernVBERT/colmodernvbertModernVBERT🟢 Ouvert26,1 %1 octobre 2025✅ Mesuré
27vidore/colSmol-256Mvidore🟢 Ouvert21,4 %22 janvier 2025✅ Mesuré
28google/siglip-large-patch16-384Google🟢 Ouvert16,4 %8 janvier 2024✅ Mesuré
29google/siglip-so400m-patch14-384Google🟢 Ouvert15,8 %8 janvier 2024✅ Mesuré
30ModernVBERT/bimodernvbertModernVBERT🟢 Ouvert15,1 %1 octobre 2025✅ Mesuré
31ModernVBERT/modernvbert-embedModernVBERT🟢 Ouvert14,7 %1 octobre 2025✅ Mesuré
32google/siglip-base-patch16-512Google🟢 Ouvert14,7 %8 janvier 2024✅ Mesuré
33google/siglip-base-patch16-384Google🟢 Ouvert11,6 %8 janvier 2024✅ Mesuré
34openai/clip-vit-large-patch14OpenAI🟢 Ouvert8,0 %26 février 2021✅ Mesuré
35google/siglip-base-patch16-256Google🟢 Ouvert6,7 %8 janvier 2024✅ Mesuré
36google/siglip-base-patch16-256-multilingualGoogle🟢 Ouvert6,2 %8 janvier 2024✅ Mesuré
37google/siglip-base-patch16-224Google🟢 Ouvert5,4 %8 janvier 2024✅ Mesuré
38openai/clip-vit-base-patch16OpenAI🟢 Ouvert4,4 %26 février 2021✅ Mesuré
39openai/clip-vit-base-patch32OpenAI🟢 Ouvert2,2 %26 février 2021✅ Mesuré

Classement établi sur 39 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 52,6 %.

Notre analyse

Un score NDCG@10 élevé indique que le modèle place plus efficacement les pages pertinentes parmi ses dix premiers résultats, avec une meilleure valorisation des documents correctement classés en tête. Cette performance est particulièrement importante pour le RAG multimodal, puisque la qualité des éléments récupérés conditionne les informations transmises au système en aval.

La lecture du classement exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement mesurée par un tiers. Le caractère public du benchmark peut également accroître le risque d’exposition des jeux et donc de contamination. La présence de tâches privées apporte néanmoins un complément, avec une procédure dédiée pour soumettre les résultats.

Avec une médiane de 53 % parmi les 39 modèles recensés et un meilleur score de 64 % pour vultr/VultronRetrieverPrime-Qwen3.5-8B, le classement montre une avance mesurée plutôt qu’une saturation au sommet. Sa portée reste centrée sur la récupération visuelle multilingue de documents d’entreprise et ne résume pas les capacités générales d’un modèle.


Sources des scores : mteb.