OCRBench
OCRBench est un benchmark créé en 2023 par Yuliang Liu et ses coauteurs pour évaluer les capacités de reconnaissance optique de caractères des grands modèles multimodaux.
OCRBench est un benchmark créé en 2023 par Yuliang Liu et ses coauteurs pour évaluer les capacités de reconnaissance optique de caractères des grands modèles multimodaux.
À partir d’images, de scènes naturelles et de documents, il mesure leur aptitude à lire et reconnaître du texte, puis à l’exploiter dans des réponses courtes. Il couvre la reconnaissance textuelle, la VQA centrée sur le texte et la compréhension de documents, offrant ainsi un cadre commun pour comparer les performances OCR de ces modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Yuliang Liu et al. |
| Capacités mesurées | image vers texte, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes à réponse courte sur image, incluant reconnaissance de texte, VQA centrée sur le texte et compréhension de documents |
| Métrique d'évaluation | accuracy / exact match, agrégée en score total |
| Accès | Public |
| Langues | principalement anglais |
| Taille du jeu | 1 000 questions issues de 29 jeux de données |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (22)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 92,3 % | 27 janvier 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,1 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,0 % | 22 septembre 2025 | Auto-déclaré |
| 4 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,0 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 90,3 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,6 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,5 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,4 % | 24 février 2026 | Auto-déclaré |
| 9 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,4 % | 21 avril 2026 | Auto-déclaré |
| 10 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,5 % | 26 janvier 2025 | Auto-déclaré |
| 11 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,1 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen2-VL-72B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,7 % | 29 août 2024 | Auto-déclaré |
| 13 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,5 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 86,4 % | 26 janvier 2025 | Auto-déclaré |
| 15 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,5 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Phi-4-multimodal-instruct | Microsoft | 🟢 Ouvert | 84,4 % | 1 février 2025 | Auto-déclaré |
| 17 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 22 septembre 2025 | Auto-déclaré |
| 18 | DeepSeek VL2 Small | DeepSeek | 🟢 Ouvert | 83,4 % | 13 décembre 2024 | Auto-déclaré |
| 19 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,9 % | 22 septembre 2025 | Auto-déclaré |
| 20 | DeepSeek VL2 | DeepSeek | 🟢 Ouvert | 81,1 % | 13 décembre 2024 | Auto-déclaré |
| 21 | DeepSeek VL2 Tiny | DeepSeek | 🟢 Ouvert | 80,9 % | 13 décembre 2024 | Auto-déclaré |
| 22 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,8 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 22 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 87,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur OCRBench indique qu’un modèle répond correctement, selon une évaluation par accuracy ou exact match, à une large part des questions portant sur le texte visible dans les images et documents. Il traduit donc une bonne capacité combinée de lecture, de reconnaissance et d’exploitation du contenu textuel. Dans la base, la médiane atteint 88 %, tandis que Kimi K2.5 de Moonshot AI obtient 92 %. Cet écart limité suggère un classement resserré et une possible saturation parmi les modèles évalués, ce qui réduit le pouvoir discriminant du score total à ce niveau de performance. La rigueur de la comparaison doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au benchmark et son recours à des questions provenant de 29 jeux de données créent également un risque potentiel de contamination. Enfin, sa portée reste centrée sur l’OCR multimodal, principalement en anglais, et ne représente pas l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.