OCRBench-V2 (zh)

OCRBench-V2 (zh) est le sous-ensemble chinois d’un benchmark consacré à l’évaluation des grands modèles multimodaux face au texte présent dans les images. Il a été créé par la Huazhong University of Science and Technology, la South China University of Technology, l’University of Adelaide…

OCRBench-V2 (zh) est le sous-ensemble chinois d’un benchmark consacré à l’évaluation des grands modèles multimodaux face au texte présent dans les images. Il a été créé par la Huazhong University of Science and Technology, la South China University of Technology, l’University of Adelaide et ByteDance.

À travers des questions-réponses visuelles, il mesure la reconnaissance et la localisation du texte chinois, la perception fine, l’analyse de mise en page ainsi que le raisonnement logique. Il sert ainsi à comparer la capacité des modèles à repérer, comprendre et exploiter un contenu textuel visuel.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkHuazhong University of Science and Technology, South China University of Technology, University of Adelaide, ByteDance
Capacités mesuréesReconnaissance, localisation visuelle du texte, perception fine, analyse de mise en page et raisonnement logique sur texte chinois
ModalitéMultimodal
Type de questionsQuestions-reponses visuelles (localisation et raisonnement sur le texte)
Métrique d'évaluationScore 0-100 (par tache)
AccèsPublic
Langueschinois
Taille du jeu10 000 paires QA verifiees humainement au total (bilingue EN/ZH), 31 scenarios ; sous-ensemble chinois (zh) extrait de ce total
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,5 %22 septembre 2025Auto-déclaré
2Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert62,1 %22 septembre 2025Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,8 %22 septembre 2025Auto-déclaré
4Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,2 %22 septembre 2025Auto-déclaré
5Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,4 %22 septembre 2025Auto-déclaré
6Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,2 %22 septembre 2025Auto-déclaré
7Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert59,2 %22 septembre 2025Auto-déclaré
8Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert59,1 %28 février 2025Auto-déclaré
9Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,8 %22 septembre 2025Auto-déclaré
10Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,6 %22 septembre 2025Auto-déclaré
11Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert55,8 %22 septembre 2025Auto-déclaré

Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 59,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une meilleure maîtrise conjointe de la localisation visuelle et du raisonnement sur du texte chinois. La notation de 0 à 100 par tâche permet de distinguer plusieurs dimensions, plutôt que de réduire l’évaluation à la seule reconnaissance de caractères. Le jeu complet repose sur 10 000 paires de questions-réponses vérifiées humainement, réparties entre l’anglais et le chinois et couvrant 31 scénarios, ce qui renforce la rigueur de son contenu. En revanche, les résultats réunis dans la base sont majoritairement auto-déclarés par les éditeurs, leur comparabilité doit donc être interprétée avec prudence. Le caractère public du benchmark implique aussi un risque possible d’exposition préalable des modèles aux données, un enjeu classique de contamination. Sa portée reste centrée sur le chinois et sur les compétences liées au texte visuel. Parmi les 11 modèles évalués, Qwen3 VL 235B A22B Thinking atteint 64 %, contre une médiane de 59 %. Cet écart modéré dessine un classement relativement resserré, tandis que le meilleur score, encore éloigné de 100 %, ne suggère pas une saturation complète du benchmark.


Sources des scores : llm-stats.