OCRBench

OCRBench est un benchmark créé en 2023 par Yuliang Liu et ses coauteurs pour évaluer les capacités de reconnaissance optique de caractères des grands modèles multimodaux.

OCRBench est un benchmark créé en 2023 par Yuliang Liu et ses coauteurs pour évaluer les capacités de reconnaissance optique de caractères des grands modèles multimodaux.

À partir d’images, de scènes naturelles et de documents, il mesure leur aptitude à lire et reconnaître du texte, puis à l’exploiter dans des réponses courtes. Il couvre la reconnaissance textuelle, la VQA centrée sur le texte et la compréhension de documents, offrant ainsi un cadre commun pour comparer les performances OCR de ces modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkYuliang Liu et al.
Capacités mesuréesimage vers texte, vision
ModalitéMultimodal
Type de questionsquestions ouvertes à réponse courte sur image, incluant reconnaissance de texte, VQA centrée sur le texte et compréhension de documents
Métrique d'évaluationaccuracy / exact match, agrégée en score total
AccèsPublic
Languesprincipalement anglais
Taille du jeu1 000 questions issues de 29 jeux de données
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (22)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.5Moonshot AI🟢 Ouvert92,3 %27 janvier 2026Auto-déclaré
2Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert92,1 %24 février 2026Auto-déclaré
3Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert92,0 %22 septembre 2025Auto-déclaré
4Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert91,0 %24 février 2026Auto-déclaré
5Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert90,3 %22 septembre 2025Auto-déclaré
6Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,6 %22 septembre 2025Auto-déclaré
7Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert89,5 %22 septembre 2025Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert89,4 %24 février 2026Auto-déclaré
9Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert89,4 %21 avril 2026Auto-déclaré
10Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,5 %26 janvier 2025Auto-déclaré
11Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert88,1 %22 septembre 2025Auto-déclaré
12Qwen2-VL-72B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,7 %29 août 2024Auto-déclaré
13Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert87,5 %22 septembre 2025Auto-déclaré
14Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert86,4 %26 janvier 2025Auto-déclaré
15Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert85,5 %22 septembre 2025Auto-déclaré
16Phi-4-multimodal-instructMicrosoft🟢 Ouvert84,4 %1 février 2025Auto-déclaré
17Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %22 septembre 2025Auto-déclaré
18DeepSeek VL2 SmallDeepSeek🟢 Ouvert83,4 %13 décembre 2024Auto-déclaré
19Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,9 %22 septembre 2025Auto-déclaré
20DeepSeek VL2DeepSeek🟢 Ouvert81,1 %13 décembre 2024Auto-déclaré
21DeepSeek VL2 TinyDeepSeek🟢 Ouvert80,9 %13 décembre 2024Auto-déclaré
22Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert80,8 %22 septembre 2025Auto-déclaré

Classement établi sur 22 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 87,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur OCRBench indique qu’un modèle répond correctement, selon une évaluation par accuracy ou exact match, à une large part des questions portant sur le texte visible dans les images et documents. Il traduit donc une bonne capacité combinée de lecture, de reconnaissance et d’exploitation du contenu textuel. Dans la base, la médiane atteint 88 %, tandis que Kimi K2.5 de Moonshot AI obtient 92 %. Cet écart limité suggère un classement resserré et une possible saturation parmi les modèles évalués, ce qui réduit le pouvoir discriminant du score total à ce niveau de performance. La rigueur de la comparaison doit aussi être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un protocole indépendant commun. L’accès public au benchmark et son recours à des questions provenant de 29 jeux de données créent également un risque potentiel de contamination. Enfin, sa portée reste centrée sur l’OCR multimodal, principalement en anglais, et ne représente pas l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.