OCRBench-V2 (zh)
OCRBench-V2 (zh) est le sous-ensemble chinois d’un benchmark consacré à l’évaluation des grands modèles multimodaux face au texte présent dans les images. Il a été créé par la Huazhong University of Science and Technology, la South China University of Technology, l’University of Adelaide…
OCRBench-V2 (zh) est le sous-ensemble chinois d’un benchmark consacré à l’évaluation des grands modèles multimodaux face au texte présent dans les images. Il a été créé par la Huazhong University of Science and Technology, la South China University of Technology, l’University of Adelaide et ByteDance.
À travers des questions-réponses visuelles, il mesure la reconnaissance et la localisation du texte chinois, la perception fine, l’analyse de mise en page ainsi que le raisonnement logique. Il sert ainsi à comparer la capacité des modèles à repérer, comprendre et exploiter un contenu textuel visuel.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Huazhong University of Science and Technology, South China University of Technology, University of Adelaide, ByteDance |
| Capacités mesurées | Reconnaissance, localisation visuelle du texte, perception fine, analyse de mise en page et raisonnement logique sur texte chinois |
| Modalité | Multimodal |
| Type de questions | Questions-reponses visuelles (localisation et raisonnement sur le texte) |
| Métrique d'évaluation | Score 0-100 (par tache) |
| Accès | Public |
| Langues | chinois |
| Taille du jeu | 10 000 paires QA verifiees humainement au total (bilingue EN/ZH), 31 scenarios ; sous-ensemble chinois (zh) extrait de ce total |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,5 % | 22 septembre 2025 | Auto-déclaré |
| 2 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,1 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,8 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,2 % | 22 septembre 2025 | Auto-déclaré |
| 5 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,4 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,1 % | 28 février 2025 | Auto-déclaré |
| 9 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,8 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,6 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,8 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 11 modèles évalués. Score médian de l'ensemble : 59,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une meilleure maîtrise conjointe de la localisation visuelle et du raisonnement sur du texte chinois. La notation de 0 à 100 par tâche permet de distinguer plusieurs dimensions, plutôt que de réduire l’évaluation à la seule reconnaissance de caractères. Le jeu complet repose sur 10 000 paires de questions-réponses vérifiées humainement, réparties entre l’anglais et le chinois et couvrant 31 scénarios, ce qui renforce la rigueur de son contenu. En revanche, les résultats réunis dans la base sont majoritairement auto-déclarés par les éditeurs, leur comparabilité doit donc être interprétée avec prudence. Le caractère public du benchmark implique aussi un risque possible d’exposition préalable des modèles aux données, un enjeu classique de contamination. Sa portée reste centrée sur le chinois et sur les compétences liées au texte visuel. Parmi les 11 modèles évalués, Qwen3 VL 235B A22B Thinking atteint 64 %, contre une médiane de 59 %. Cet écart modéré dessine un classement relativement resserré, tandis que le meilleur score, encore éloigné de 100 %, ne suggère pas une saturation complète du benchmark.
Sources des scores : llm-stats.