OCRBench-V2 (en)
OCRBench-V2 (en) est le sous-ensemble anglophone d’un benchmark bilingue consacré à l’OCR avancé des Large Multimodal Models. Publié en 2024 par le groupe de recherche académique de Yuliang Liu, avec Ling Fu, Zhebin Kuang et leurs coauteurs, il repose sur des questions-réponses centrées…
OCRBench-V2 (en) est le sous-ensemble anglophone d’un benchmark bilingue consacré à l’OCR avancé des Large Multimodal Models. Publié en 2024 par le groupe de recherche académique de Yuliang Liu, avec Ling Fu, Zhebin Kuang et leurs coauteurs, il repose sur des questions-réponses centrées sur le texte présent dans les images.
L’évaluation couvre la localisation et la reconnaissance du texte, la perception fine des mises en page, le parsing d’éléments complexes et le raisonnement logique. Elle vise ainsi à mesurer la capacité des modèles à interpréter un contenu visuel textuel, au-delà de sa simple transcription.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Groupe de recherche de Yuliang Liu (Ling Fu, Zhebin Kuang et al., milieu académique) |
| Capacités mesurées | OCR avancé pour LMM : localisation de texte, perception fine, perception de mise en page, parsing d'éléments complexes, raisonnement logique (31 scénarios, 4x plus de tâches qu'OCRBench v1) |
| Modalité | Multimodal |
| Type de questions | Questions-réponses centrées texte (localisation, reconnaissance, parsing, raisonnement) ; sous-ensemble anglais |
| Métrique d'évaluation | Score sur 100 (métriques variées selon la tâche) |
| Accès | Public |
| Langues | Anglais (sous-ensemble 'en' du benchmark bilingue anglais/chinois) |
| Taille du jeu | 10 000 paires Q-R vérifiées humainement (benchmark bilingue EN/ZH) ; sous-ensemble anglais ici |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,4 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,4 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,1 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,8 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,4 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,9 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,7 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,2 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,6 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,5 % | 26 janvier 2025 | Auto-déclaré |
| 12 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,2 % | 28 février 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués. Score médian de l'ensemble : 63,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une bonne maîtrise combinée de la localisation, de la reconnaissance, du parsing et du raisonnement sur du texte anglais en contexte visuel. Les métriques variant selon les tâches, le score sur 100 constitue une synthèse de performances obtenues dans 31 scénarios plutôt qu’une mesure d’une seule aptitude. Les 10 000 paires de questions-réponses vérifiées humainement renforcent la rigueur du jeu d’évaluation. En revanche, les résultats recensés étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend du respect d’un protocole commun.
Parmi les 12 modèles évalués, la médiane atteint 64 %, tandis que Qwen3 VL 32B Thinking arrive en tête à 68 %. Cet écart limité entre la médiane et le meilleur score montre un classement relativement resserré dans cette sélection, sans établir à lui seul une saturation complète du benchmark. Sa portée reste centrée sur le sous-ensemble anglais et sur les compétences OCR des modèles multimodaux. Son accès public implique aussi que la contamination des données doit être considérée comme un risque possible lors de l’interprétation des scores.
Sources des scores : llm-stats.