CC-OCR
CC-OCR est un benchmark conçu en 2024 par Alibaba Group, via Alibaba Research et l’équipe Qwen, pour évaluer les capacités de lecture des Large Multimodal Models. Il couvre la reconnaissance de texte dans des scènes variées et plusieurs langues, y compris les textes orientés de…
CC-OCR est un benchmark conçu en 2024 par Alibaba Group, via Alibaba Research et l’équipe Qwen, pour évaluer les capacités de lecture des Large Multimodal Models. Il couvre la reconnaissance de texte dans des scènes variées et plusieurs langues, y compris les textes orientés de différentes manières et leur ancrage visuel.
L’évaluation s’étend aussi au parsing de documents et à l’extraction d’informations structurées. CC-OCR sert ainsi à mesurer la capacité des modèles multimodaux à interpréter fidèlement des contenus textuels complexes, tout en repérant les phénomènes d’hallucination ou de répétition.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Alibaba Group (Alibaba Research / équipe Qwen) |
| Capacités mesurées | OCR, multimodal, lecture de texte multi-scènes et multilingue, parsing de documents, extraction d'information structurée, vision |
| Modalité | Multimodal |
| Type de questions | OCR / lecture de texte, parsing de documents, extraction d'informations clés (4 tracks) |
| Métrique d'évaluation | exactitude / scores par track (basés sur distance d'édition et F1), score global agrégé |
| Accès | Public |
| Licence | MIT |
| Langues | multilingue (plusieurs langues) |
| Taille du jeu | 7058 images annotées, 39 sous-ensembles (~41% issus d'applications réelles) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (18)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 83,4 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,2 % | 22 septembre 2025 | Auto-déclaré |
| 3 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,9 % | 16 avril 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,8 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,5 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,2 % | 21 avril 2026 | Auto-déclaré |
| 7 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,0 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,7 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 80,3 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,9 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 79,8 % | 26 janvier 2025 | Auto-déclaré |
| 13 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 26 janvier 2025 | Auto-déclaré |
| 14 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,8 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen2.5 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 77,1 % | 28 février 2025 | Auto-déclaré |
| 16 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,3 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,2 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 73,8 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 18 modèles évalués. Score médian de l'ensemble : 80,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur CC-OCR traduit une bonne restitution du texte et des informations attendues dans les quatre tracks, selon des mesures fondées sur la distance d’édition et le F1, puis agrégées dans un score global. La diversité des scènes, des langues et des tâches, ainsi que la part d’images provenant d’applications réelles, donnent au benchmark une portée pratique pour l’OCR multimodal. Cette portée reste toutefois centrée sur la lecture visuelle, le parsing documentaire et l’extraction d’informations, et ne représente pas l’ensemble des capacités d’un modèle multimodal.
Le classement apparaît fortement resserré autour d’un niveau élevé, avec une médiane de 80 % et un meilleur score de 83 % pour Qwen3.6 Plus. Cet écart réduit suggère une capacité limitée à départager finement les modèles classés, ce qui peut signaler un début de saturation sur cet ensemble. La rigueur d’interprétation est aussi restreinte par l’origine des résultats, majoritairement auto-déclarés par les éditeurs. Enfin, les 18 modèles classés sont tous édités par Qwen, également impliqué dans le développement de CC-OCR. Le classement renseigne donc surtout sur les écarts internes à cette gamme et ne constitue pas une comparaison indépendante entre éditeurs.
Sources des scores : llm-stats.