OCRBench_V2

OCRBench_V2 est un benchmark bilingue conçu en 2024 par Ling Fu, Zhebin Kuang, Yuliang Liu et les autres auteurs d’OCRBench v2. Il évalue la capacité des grands modèles multimodaux à traiter le texte présent dans des images, en anglais comme en chinois.

OCRBench_V2 est un benchmark bilingue conçu en 2024 par Ling Fu, Zhebin Kuang, Yuliang Liu et les autres auteurs d’OCRBench v2. Il évalue la capacité des grands modèles multimodaux à traiter le texte présent dans des images, en anglais comme en chinois.

Son protocole couvre huit capacités centrales de l’OCR, dont la reconnaissance, la localisation, l’extraction, le parsing, le calcul, la compréhension et le raisonnement, à travers 31 scénarios. Les questions-réponses visuelles vérifiées par des humains servent à comparer les modèles sur des tâches allant de la lecture à l’exploitation raisonnée du contenu textuel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAuteurs OCRBench v2 (Ling Fu, Zhebin Kuang, Yuliang Liu et al.)
Capacités mesuréesOCR multimodal bilingue : reconnaissance de texte, referencement, spotting, extraction, parsing, calcul, comprehension et raisonnement sur 31 scenarios.
ModalitéMultimodal
Type de questionsQuestions-reponses visuelles (QA), incluant localisation/spotting de texte
Métrique d'évaluationScore agrege sur 100 (metriques par tache)
AccèsPublic
LicenceCC BY-SA 4.0 (page projet)
LanguesAnglais, chinois (bilingue)
Taille du jeu10 000 paires QA verifiees par des humains (test public) + 1 500 images (test prive)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire67,1 %31 mai 2026Auto-déclaré
2Nova 2 ProAmazon🔒 Propriétaire64,5 %2 décembre 2025Auto-déclaré
3Seed 2.1 ProByteDance🔒 Propriétaire63,2 %24 juin 2026Auto-déclaré
4Seed 2.1 TurboByteDance🔒 Propriétaire62,8 %24 juin 2026Auto-déclaré
5Nova 2 OmniAmazon🔒 Propriétaire58,2 %2 décembre 2025Auto-déclaré
6Qwen2.5-Omni-7BAlibaba Cloud / Qwen Team🟢 Ouvert57,8 %27 mars 2025Auto-déclaré
7Nova 2 LiteAmazon🔒 Propriétaire56,1 %2 décembre 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 62,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur OCRBench_V2 traduit une maîtrise étendue des différentes tâches évaluées, de la reconnaissance et du spotting de texte jusqu’au calcul et au raisonnement visuel. Le score agrégé sur 100 synthétise toutefois des métriques propres à chaque tâche, ce qui invite à l’interpréter comme une performance globale plutôt que comme une mesure unique et uniforme. Dans la base, Qwen3.7-Plus arrive en tête avec 67 %, contre une médiane de 63 % sur sept modèles. Cet écart limité montre un avantage mesuré du premier, sans indiquer une saturation du benchmark puisque le meilleur résultat reste éloigné du maximum théorique. La vérification humaine des 10 000 paires QA renforce la qualité du jeu public. En revanche, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparabilité dépend de l’application cohérente du protocole. Le caractère public du test appelle aussi à surveiller le risque de contamination. Enfin, la portée reste circonscrite à l’OCR multimodal bilingue et aux 31 scénarios couverts.


Sources des scores : llm-stats.