OCRBench_V2
OCRBench_V2 est un benchmark bilingue conçu en 2024 par Ling Fu, Zhebin Kuang, Yuliang Liu et les autres auteurs d’OCRBench v2. Il évalue la capacité des grands modèles multimodaux à traiter le texte présent dans des images, en anglais comme en chinois.
OCRBench_V2 est un benchmark bilingue conçu en 2024 par Ling Fu, Zhebin Kuang, Yuliang Liu et les autres auteurs d’OCRBench v2. Il évalue la capacité des grands modèles multimodaux à traiter le texte présent dans des images, en anglais comme en chinois.
Son protocole couvre huit capacités centrales de l’OCR, dont la reconnaissance, la localisation, l’extraction, le parsing, le calcul, la compréhension et le raisonnement, à travers 31 scénarios. Les questions-réponses visuelles vérifiées par des humains servent à comparer les modèles sur des tâches allant de la lecture à l’exploitation raisonnée du contenu textuel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Auteurs OCRBench v2 (Ling Fu, Zhebin Kuang, Yuliang Liu et al.) |
| Capacités mesurées | OCR multimodal bilingue : reconnaissance de texte, referencement, spotting, extraction, parsing, calcul, comprehension et raisonnement sur 31 scenarios. |
| Modalité | Multimodal |
| Type de questions | Questions-reponses visuelles (QA), incluant localisation/spotting de texte |
| Métrique d'évaluation | Score agrege sur 100 (metriques par tache) |
| Accès | Public |
| Licence | CC BY-SA 4.0 (page projet) |
| Langues | Anglais, chinois (bilingue) |
| Taille du jeu | 10 000 paires QA verifiees par des humains (test public) + 1 500 images (test prive) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 67,1 % | 31 mai 2026 | Auto-déclaré |
| 2 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 64,5 % | 2 décembre 2025 | Auto-déclaré |
| 3 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 63,2 % | 24 juin 2026 | Auto-déclaré |
| 4 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 62,8 % | 24 juin 2026 | Auto-déclaré |
| 5 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 58,2 % | 2 décembre 2025 | Auto-déclaré |
| 6 | Qwen2.5-Omni-7B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,8 % | 27 mars 2025 | Auto-déclaré |
| 7 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 56,1 % | 2 décembre 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 62,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur OCRBench_V2 traduit une maîtrise étendue des différentes tâches évaluées, de la reconnaissance et du spotting de texte jusqu’au calcul et au raisonnement visuel. Le score agrégé sur 100 synthétise toutefois des métriques propres à chaque tâche, ce qui invite à l’interpréter comme une performance globale plutôt que comme une mesure unique et uniforme. Dans la base, Qwen3.7-Plus arrive en tête avec 67 %, contre une médiane de 63 % sur sept modèles. Cet écart limité montre un avantage mesuré du premier, sans indiquer une saturation du benchmark puisque le meilleur résultat reste éloigné du maximum théorique. La vérification humaine des 10 000 paires QA renforce la qualité du jeu public. En revanche, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole. Le caractère public du test appelle aussi à surveiller le risque de contamination. Enfin, la portée reste circonscrite à l’OCR multimodal bilingue et aux 31 scénarios couverts.
Sources des scores : llm-stats.