OCRBench-V2 (en)

OCRBench-V2 (en) est le sous-ensemble anglophone d’un benchmark bilingue consacré à l’OCR avancé des Large Multimodal Models. Publié en 2024 par le groupe de recherche académique de Yuliang Liu, avec Ling Fu, Zhebin Kuang et leurs coauteurs, il repose sur des questions-réponses centrées…

OCRBench-V2 (en) est le sous-ensemble anglophone d’un benchmark bilingue consacré à l’OCR avancé des Large Multimodal Models. Publié en 2024 par le groupe de recherche académique de Yuliang Liu, avec Ling Fu, Zhebin Kuang et leurs coauteurs, il repose sur des questions-réponses centrées sur le texte présent dans les images.

L’évaluation couvre la localisation et la reconnaissance du texte, la perception fine des mises en page, le parsing d’éléments complexes et le raisonnement logique. Elle vise ainsi à mesurer la capacité des modèles à interpréter un contenu visuel textuel, au-delà de sa simple transcription.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGroupe de recherche de Yuliang Liu (Ling Fu, Zhebin Kuang et al., milieu académique)
Capacités mesuréesOCR avancé pour LMM : localisation de texte, perception fine, perception de mise en page, parsing d'éléments complexes, raisonnement logique (31 scénarios, 4x plus de tâches qu'OCRBench v1)
ModalitéMultimodal
Type de questionsQuestions-réponses centrées texte (localisation, reconnaissance, parsing, raisonnement) ; sous-ensemble anglais
Métrique d'évaluationScore sur 100 (métriques variées selon la tâche)
AccèsPublic
LanguesAnglais (sous-ensemble 'en' du benchmark bilingue anglais/chinois)
Taille du jeu10 000 paires Q-R vérifiées humainement (benchmark bilingue EN/ZH) ; sous-ensemble anglais ici
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,4 %22 septembre 2025Auto-déclaré
2Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,4 %22 septembre 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,1 %22 septembre 2025Auto-déclaré
4Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert66,8 %22 septembre 2025Auto-déclaré
5Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert65,4 %22 septembre 2025Auto-déclaré
6Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,9 %22 septembre 2025Auto-déclaré
7Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,7 %22 septembre 2025Auto-déclaré
8Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,2 %22 septembre 2025Auto-déclaré
9Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert62,6 %22 septembre 2025Auto-déclaré
10Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert61,8 %22 septembre 2025Auto-déclaré
11Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,5 %26 janvier 2025Auto-déclaré
12Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,2 %28 février 2025Auto-déclaré

Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 63,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une bonne maîtrise combinée de la localisation, de la reconnaissance, du parsing et du raisonnement sur du texte anglais en contexte visuel. Les métriques variant selon les tâches, le score sur 100 constitue une synthèse de performances obtenues dans 31 scénarios plutôt qu’une mesure d’une seule aptitude. Les 10 000 paires de questions-réponses vérifiées humainement renforcent la rigueur du jeu d’évaluation. En revanche, les résultats recensés étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend du respect d’un protocole commun.

Parmi les 12 modèles évalués, la médiane atteint 64 %, tandis que Qwen3 VL 32B Thinking arrive en tête à 68 %. Cet écart limité entre la médiane et le meilleur score montre un classement relativement resserré dans cette sélection, sans établir à lui seul une saturation complète du benchmark. Sa portée reste centrée sur le sous-ensemble anglais et sur les compétences OCR des modèles multimodaux. Son accès public implique aussi que la contamination des données doit être considérée comme un risque possible lors de l’interprétation des scores.


Sources des scores : llm-stats.