CC-OCR

CC-OCR est un benchmark conçu en 2024 par Alibaba Group, via Alibaba Research et l’équipe Qwen, pour évaluer les capacités de lecture des Large Multimodal Models. Il couvre la reconnaissance de texte dans des scènes variées et plusieurs langues, y compris les textes orientés de…

CC-OCR est un benchmark conçu en 2024 par Alibaba Group, via Alibaba Research et l’équipe Qwen, pour évaluer les capacités de lecture des Large Multimodal Models. Il couvre la reconnaissance de texte dans des scènes variées et plusieurs langues, y compris les textes orientés de différentes manières et leur ancrage visuel.

L’évaluation s’étend aussi au parsing de documents et à l’extraction d’informations structurées. CC-OCR sert ainsi à mesurer la capacité des modèles multimodaux à interpréter fidèlement des contenus textuels complexes, tout en repérant les phénomènes d’hallucination ou de répétition.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAlibaba Group (Alibaba Research / équipe Qwen)
Capacités mesuréesOCR, multimodal, lecture de texte multi-scènes et multilingue, parsing de documents, extraction d'information structurée, vision
ModalitéMultimodal
Type de questionsOCR / lecture de texte, parsing de documents, extraction d'informations clés (4 tracks)
Métrique d'évaluationexactitude / scores par track (basés sur distance d'édition et F1), score global agrégé
AccèsPublic
LicenceMIT
Languesmultilingue (plusieurs langues)
Taille du jeu7058 images annotées, 39 sous-ensembles (~41% issus d'applications réelles)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (18)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire83,4 %31 mars 2026Auto-déclaré
2Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,2 %22 septembre 2025Auto-déclaré
3Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert81,9 %16 avril 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert81,8 %24 février 2026Auto-déclaré
5Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,5 %22 septembre 2025Auto-déclaré
6Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert81,2 %21 avril 2026Auto-déclaré
7Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert81,0 %24 février 2026Auto-déclaré
8Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %22 septembre 2025Auto-déclaré
9Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert80,7 %24 février 2026Auto-déclaré
10Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert80,3 %22 septembre 2025Auto-déclaré
11Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,9 %22 septembre 2025Auto-déclaré
12Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert79,8 %26 janvier 2025Auto-déclaré
13Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,8 %26 janvier 2025Auto-déclaré
14Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert77,8 %22 septembre 2025Auto-déclaré
15Qwen2.5 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert77,1 %28 février 2025Auto-déclaré
16Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert76,3 %22 septembre 2025Auto-déclaré
17Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert76,2 %22 septembre 2025Auto-déclaré
18Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert73,8 %22 septembre 2025Auto-déclaré

Classement établi sur 18 modèles évalués. Score médian de l'ensemble : 80,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur CC-OCR traduit une bonne restitution du texte et des informations attendues dans les quatre tracks, selon des mesures fondées sur la distance d’édition et le F1, puis agrégées dans un score global. La diversité des scènes, des langues et des tâches, ainsi que la part d’images provenant d’applications réelles, donnent au benchmark une portée pratique pour l’OCR multimodal. Cette portée reste toutefois centrée sur la lecture visuelle, le parsing documentaire et l’extraction d’informations, et ne représente pas l’ensemble des capacités d’un modèle multimodal.

Le classement apparaît fortement resserré autour d’un niveau élevé, avec une médiane de 80 % et un meilleur score de 83 % pour Qwen3.6 Plus. Cet écart réduit suggère une capacité limitée à départager finement les modèles classés, ce qui peut signaler un début de saturation sur cet ensemble. La rigueur d’interprétation est aussi restreinte par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Enfin, les 18 modèles classés sont tous édités par Qwen, également impliqué dans le développement de CC-OCR. Le classement renseigne donc surtout sur les écarts internes à cette gamme et ne constitue pas une comparaison indépendante entre éditeurs.


Sources des scores : llm-stats.