Jina Visual Document Retrieval
MTEB: Jina Visual Document Retrieval est un benchmark créé par Jina AI pour évaluer la recherche de documents visuels dans des contextes multilingues et multi-domaines. Il couvre des contenus à la mise en page riche, notamment des graphiques, cartes, tableaux, scans et captures d’écran.
MTEB: Jina Visual Document Retrieval est un benchmark créé par Jina AI pour évaluer la recherche de documents visuels dans des contextes multilingues et multi-domaines. Il couvre des contenus à la mise en page riche, notamment des graphiques, cartes, tableaux, scans et captures d’écran.
L’évaluation repose sur l’appariement entre une requête textuelle et l’image d’un document, dans des domaines comme la médecine, le droit, la finance ou la technique. Le benchmark sert ainsi à comparer la capacité des modèles à retrouver des documents visuellement et sémantiquement pertinents.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Jina AI |
| Capacités mesurées | Evalue la recherche de documents visuels sur des types de documents multilingues, multi-domaines et a mises en page riches (graphiques, cartes, tableaux, scans, captures d'ecran) couvrant medecine, droit, finance, technique, etc. |
| Modalité | image,text |
| Type de questions | Recherche de documents visuels (appariement image de document <-> requete texte) |
| Métrique d'évaluation | nDCG@10 |
| Accès | Public |
| Langues | Multilingue (20 langues) |
| Taille du jeu | 95 taches sur 20 langues |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | jinaai/jina-embeddings-v4 | Jina AI | 🟢 Ouvert | 81,0 % | 24 juin 2025 | ✅ Mesuré |
| 2 | vidore/colqwen2.5-v0.2 | vidore | 🟢 Ouvert | 75,6 % | 31 janvier 2025 | ✅ Mesuré |
| 3 | voyageai/voyage-multimodal-3 | Voyage AI | 🟢 Ouvert | 69,5 % | 10 novembre 2024 | ✅ Mesuré |
| 4 | vidore/colpali-v1.3 | vidore | 🟢 Ouvert | 66,1 % | 1 novembre 2024 | ✅ Mesuré |
| 5 | vidore/colpali-v1.2 | vidore | 🟢 Ouvert | 64,4 % | 26 août 2024 | ✅ Mesuré |
Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 69,5 %.
Notre analyse
Un score nDCG@10 élevé indique que le modèle place plus souvent les documents pertinents parmi les dix premiers résultats, en accordant davantage de poids aux meilleures positions. Le classement montre un avantage net pour jinaai/jina-embeddings-v4, à 81 %, face à une médiane de 70 % sur les cinq modèles évalués. Cet écart suggère une différenciation encore visible entre les systèmes, tandis que le meilleur résultat reste inférieur au maximum théorique, ce qui ne traduit pas une saturation complète.
La portée du benchmark demeure ciblée sur la recherche de documents visuels et ne résume pas les capacités générales d’un modèle. Sa diversité de langues, de domaines et de mises en page renforce néanmoins l’intérêt de la comparaison dans ce cadre précis. L’accès public appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur fiabilité dépend moins d’une mesure indépendante et homogène. Le classement constitue donc un indicateur comparatif utile, à lire avec prudence plutôt qu’une validation externe définitive.
Sources des scores : mteb.