ViDoRe V3
MTEB: ViDoRe V3 est un benchmark conçu par ILLUIN Technology avec NVIDIA pour évaluer la récupération multilingue de documents visuels complexes. Il couvre des contenus d’entreprise multimodaux issus notamment de la finance, de l’industrie, de l’informatique et du secteur pharmaceutique.
MTEB: ViDoRe V3 est un benchmark conçu par ILLUIN Technology avec NVIDIA pour évaluer la récupération multilingue de documents visuels complexes. Il couvre des contenus d’entreprise multimodaux issus notamment de la finance, de l’industrie, de l’informatique et du secteur pharmaceutique.
Publié en 2025, il mesure la capacité des modèles à retrouver des pages pertinentes et à soutenir des systèmes de RAG multimodal. Son cadre commun facilite la comparaison des modèles sur des tâches représentatives de la recherche d’information dans des environnements professionnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ILLUIN Technology (avec NVIDIA) |
| Capacités mesurées | Récupération de documents visuels multilingue sur documents d'entreprise complexes (finance, industrie, informatique, pharma, etc.), RAG multimodal |
| Modalité | image,text |
| Type de questions | récupération de documents visuels / RAG multimodal d'entreprise |
| Métrique d'évaluation | NDCG@10 |
| Accès | Public |
| Langues | 6 langues (anglais, français, espagnol, allemand, italien, portugais) |
| Taille du jeu | 26 000 pages, 3 099 requêtes (10 jeux de données) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (39)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | vultr/VultronRetrieverPrime-Qwen3.5-8B | vultr | 🟢 Ouvert | 64,3 % | 18 juin 2026 | ✅ Mesuré |
| 2 | vultr/VultronRetrieverCore-Qwen3.5-4.5B | vultr | 🟢 Ouvert | 63,6 % | 22 juin 2026 | ✅ Mesuré |
| 3 | nvidia/nemotron-colembed-vl-8b-v2 | NVIDIA | 🟢 Ouvert | 63,4 % | 7 janvier 2026 | ✅ Mesuré |
| 4 | webAI-Official/webAI-ColVec1-9b | webAI-Official | 🟢 Ouvert | 63,0 % | 5 avril 2026 | ✅ Mesuré |
| 5 | webAI-Official/webAI-ColVec1-4b | webAI-Official | 🟢 Ouvert | 62,2 % | 5 avril 2026 | ✅ Mesuré |
| 6 | TomoroAI/tomoro-colqwen3-embed-8b | TomoroAI | 🟢 Ouvert | 61,6 % | 26 novembre 2025 | ✅ Mesuré |
| 7 | nvidia/nemotron-colembed-vl-4b-v2 | NVIDIA | 🟢 Ouvert | 61,5 % | 7 janvier 2026 | ✅ Mesuré |
| 8 | athrael-soju/colqwen3.5-4.5B-v3 | athrael-soju | 🟢 Ouvert | 61,5 % | 15 mars 2026 | ✅ Mesuré |
| 9 | OpenSearch-AI/Ops-Colqwen3-4B | OpenSearch-AI | 🟢 Ouvert | 61,2 % | 24 janvier 2026 | ✅ Mesuré |
| 10 | TomoroAI/tomoro-colqwen3-embed-4b | TomoroAI | 🟢 Ouvert | 60,2 % | 26 novembre 2025 | ✅ Mesuré |
| 11 | nvidia/llama-nemotron-colembed-vl-3b-v2 | NVIDIA | 🟢 Ouvert | 59,8 % | 21 janvier 2026 | ✅ Mesuré |
| 12 | Qwen/Qwen3-VL-Embedding-8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,8 % | 8 janvier 2026 | ✅ Mesuré |
| 13 | jinaai/jina-embeddings-v4 | Jina AI | 🟢 Ouvert | 57,5 % | 24 juin 2025 | ✅ Mesuré |
| 14 | nomic-ai/colnomic-embed-multimodal-7b | Nomic AI | 🟢 Ouvert | 57,3 % | 31 mars 2025 | ✅ Mesuré |
| 15 | nvidia/llama-nemoretriever-colembed-3b-v1 | NVIDIA | 🟢 Ouvert | 57,3 % | 27 juin 2025 | ✅ Mesuré |
| 16 | vultr/VultronRetrieverFlash-Qwen3.5-0.8B | vultr | 🟢 Ouvert | 56,2 % | 21 juin 2026 | ✅ Mesuré |
| 17 | Verm1ion/ColTurk-VDR-Qwen3VL-4B-v1.0 | Verm1ion | 🟢 Ouvert | 55,8 % | 11 juin 2026 | ✅ Mesuré |
| 18 | nomic-ai/colnomic-embed-multimodal-3b | Nomic AI | 🟢 Ouvert | 55,8 % | 31 mars 2025 | ✅ Mesuré |
| 19 | nvidia/llama-nemoretriever-colembed-1b-v1 | NVIDIA | 🟢 Ouvert | 55,6 % | 27 juin 2025 | ✅ Mesuré |
| 20 | Qwen/Qwen3-VL-Embedding-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,6 % | 8 janvier 2026 | ✅ Mesuré |
| 21 | vidore/colqwen2.5-v0.2 | vidore | 🟢 Ouvert | 51,9 % | 31 janvier 2025 | ✅ Mesuré |
| 22 | jinaai/jina-embeddings-v5-omni-small | Jina AI | 🟢 Ouvert | 45,6 % | 1 avril 2026 | ✅ Mesuré |
| 23 | jinaai/jina-embeddings-v5-omni-nano | Jina AI | 🟢 Ouvert | 45,6 % | 1 avril 2026 | ✅ Mesuré |
| 24 | vidore/colqwen2-v1.0 | vidore | 🟢 Ouvert | 44,7 % | 3 novembre 2025 | ✅ Mesuré |
| 25 | vidore/colpali-v1.3 | vidore | 🟢 Ouvert | 43,1 % | 1 novembre 2024 | ✅ Mesuré |
| 26 | ModernVBERT/colmodernvbert | ModernVBERT | 🟢 Ouvert | 26,1 % | 1 octobre 2025 | ✅ Mesuré |
| 27 | vidore/colSmol-256M | vidore | 🟢 Ouvert | 21,4 % | 22 janvier 2025 | ✅ Mesuré |
| 28 | google/siglip-large-patch16-384 | 🟢 Ouvert | 16,4 % | 8 janvier 2024 | ✅ Mesuré | |
| 29 | google/siglip-so400m-patch14-384 | 🟢 Ouvert | 15,8 % | 8 janvier 2024 | ✅ Mesuré | |
| 30 | ModernVBERT/bimodernvbert | ModernVBERT | 🟢 Ouvert | 15,1 % | 1 octobre 2025 | ✅ Mesuré |
| 31 | ModernVBERT/modernvbert-embed | ModernVBERT | 🟢 Ouvert | 14,7 % | 1 octobre 2025 | ✅ Mesuré |
| 32 | google/siglip-base-patch16-512 | 🟢 Ouvert | 14,7 % | 8 janvier 2024 | ✅ Mesuré | |
| 33 | google/siglip-base-patch16-384 | 🟢 Ouvert | 11,6 % | 8 janvier 2024 | ✅ Mesuré | |
| 34 | openai/clip-vit-large-patch14 | OpenAI | 🟢 Ouvert | 8,0 % | 26 février 2021 | ✅ Mesuré |
| 35 | google/siglip-base-patch16-256 | 🟢 Ouvert | 6,7 % | 8 janvier 2024 | ✅ Mesuré | |
| 36 | google/siglip-base-patch16-256-multilingual | 🟢 Ouvert | 6,2 % | 8 janvier 2024 | ✅ Mesuré | |
| 37 | google/siglip-base-patch16-224 | 🟢 Ouvert | 5,4 % | 8 janvier 2024 | ✅ Mesuré | |
| 38 | openai/clip-vit-base-patch16 | OpenAI | 🟢 Ouvert | 4,4 % | 26 février 2021 | ✅ Mesuré |
| 39 | openai/clip-vit-base-patch32 | OpenAI | 🟢 Ouvert | 2,2 % | 26 février 2021 | ✅ Mesuré |
Classement établi sur 39 modèles évalués, dont 15 de grands éditeurs. Score médian de l'ensemble : 52,6 %.
Notre analyse
Un score NDCG@10 élevé indique que le modèle place plus efficacement les pages pertinentes parmi ses dix premiers résultats, avec une meilleure valorisation des documents correctement classés en tête. Cette performance est particulièrement importante pour le RAG multimodal, puisque la qualité des éléments récupérés conditionne les informations transmises au système en aval.
La lecture du classement exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement mesurée par un tiers. Le caractère public du benchmark peut également accroître le risque d’exposition des jeux et donc de contamination. La présence de tâches privées apporte néanmoins un complément, avec une procédure dédiée pour soumettre les résultats.
Avec une médiane de 53 % parmi les 39 modèles recensés et un meilleur score de 64 % pour vultr/VultronRetrieverPrime-Qwen3.5-8B, le classement montre une avance mesurée plutôt qu’une saturation au sommet. Sa portée reste centrée sur la récupération visuelle multilingue de documents d’entreprise et ne résume pas les capacités générales d’un modèle.
Sources des scores : mteb.