Jina Visual Document Retrieval

MTEB: Jina Visual Document Retrieval est un benchmark créé par Jina AI pour évaluer la recherche de documents visuels dans des contextes multilingues et multi-domaines. Il couvre des contenus à la mise en page riche, notamment des graphiques, cartes, tableaux, scans et captures d’écran.

MTEB: Jina Visual Document Retrieval est un benchmark créé par Jina AI pour évaluer la recherche de documents visuels dans des contextes multilingues et multi-domaines. Il couvre des contenus à la mise en page riche, notamment des graphiques, cartes, tableaux, scans et captures d’écran.

L’évaluation repose sur l’appariement entre une requête textuelle et l’image d’un document, dans des domaines comme la médecine, le droit, la finance ou la technique. Le benchmark sert ainsi à comparer la capacité des modèles à retrouver des documents visuellement et sémantiquement pertinents.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkJina AI
Capacités mesuréesEvalue la recherche de documents visuels sur des types de documents multilingues, multi-domaines et a mises en page riches (graphiques, cartes, tableaux, scans, captures d'ecran) couvrant medecine, droit, finance, technique, etc.
Modalitéimage,text
Type de questionsRecherche de documents visuels (appariement image de document <-> requete texte)
Métrique d'évaluationnDCG@10
AccèsPublic
LanguesMultilingue (20 langues)
Taille du jeu95 taches sur 20 langues
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1jinaai/jina-embeddings-v4Jina AI🟢 Ouvert81,0 %24 juin 2025✅ Mesuré
2vidore/colqwen2.5-v0.2vidore🟢 Ouvert75,6 %31 janvier 2025✅ Mesuré
3voyageai/voyage-multimodal-3Voyage AI🟢 Ouvert69,5 %10 novembre 2024✅ Mesuré
4vidore/colpali-v1.3vidore🟢 Ouvert66,1 %1 novembre 2024✅ Mesuré
5vidore/colpali-v1.2vidore🟢 Ouvert64,4 %26 août 2024✅ Mesuré

Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 69,5 %.

Notre analyse

Un score nDCG@10 élevé indique que le modèle place plus souvent les documents pertinents parmi les dix premiers résultats, en accordant davantage de poids aux meilleures positions. Le classement montre un avantage net pour jinaai/jina-embeddings-v4, à 81 %, face à une médiane de 70 % sur les cinq modèles évalués. Cet écart suggère une différenciation encore visible entre les systèmes, tandis que le meilleur résultat reste inférieur au maximum théorique, ce qui ne traduit pas une saturation complète.

La portée du benchmark demeure ciblée sur la recherche de documents visuels et ne résume pas les capacités générales d’un modèle. Sa diversité de langues, de domaines et de mises en page renforce néanmoins l’intérêt de la comparaison dans ce cadre précis. L’accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur fiabilité dépend moins d’une mesure indépendante et homogène. Le classement constitue donc un indicateur comparatif utile, à lire avec prudence plutôt qu’une validation externe définitive.


Sources des scores : mteb.