OmniDocBench 1.5
OmniDocBench 1.5 est un benchmark créé par OpenDataLab pour évaluer la compréhension et le parsing de documents par les grands modèles multimodaux. Il couvre notamment l’OCR, l’extraction d’information, l’analyse de la mise en page, les tables, les formules et la réponse à des questions…
OmniDocBench 1.5 est un benchmark créé par OpenDataLab pour évaluer la compréhension et le parsing de documents par les grands modèles multimodaux. Il couvre notamment l’OCR, l’extraction d’information, l’analyse de la mise en page, les tables, les formules et la réponse à des questions visuelles.
L’évaluation porte sur le traitement bout-en-bout de pages PDF, jusqu’à la restitution de leur ordre de lecture. Des métriques spécialisées mesurent chaque composante, tandis que l’appariement Hybrid Matching introduit dans cette version vise à affiner la comparaison des sorties.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenDataLab |
| Capacités mesurées | Compréhension et parsing de documents pour LMM : OCR, extraction d'information, mise en page, tables, formules, VQA, ordre de lecture |
| Modalité | Multimodal |
| Type de questions | Parsing de documents bout-en-bout (OCR, détection de mise en page, reconnaissance de tables/formules, ordre de lecture) |
| Métrique d'évaluation | Normalized Edit Distance, BLEU, METEOR, TEDS, COCODet (mAP/mAR), CDM ; v1.5 introduit un appariement hybride (Hybrid Matching) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | Anglais, chinois simplifié, mixte EN-ZH |
| Taille du jeu | 1 651 pages PDF (v1.5), 10 types de documents, 5 types de mise en page, 5 langues |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | MiniMax M3 | MiniMax | 🟢 Ouvert | 91,6 % | 1 juin 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 91,4 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 91,2 % | 31 mars 2026 | Auto-déclaré |
| 4 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,9 % | 16 avril 2026 | Auto-déclaré |
| 5 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,8 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,3 % | 24 février 2026 | Auto-déclaré |
| 7 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 89,1 % | 5 mars 2026 | Auto-déclaré |
| 8 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,9 % | 24 février 2026 | Auto-déclaré |
| 9 | Kimi K2.5 | Moonshot AI | 🟢 Ouvert | 88,8 % | 27 janvier 2026 | Auto-déclaré |
| 10 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 87,5 % | 5 mai 2026 | Auto-déclaré |
| 11 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 87,4 % | 17 mars 2026 | Auto-déclaré |
| 12 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 75,8 % | 17 mars 2026 | Auto-déclaré |
| 13 | Gemma 4 12B | 🟢 Ouvert | 16,4 % | 23 mai 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 89,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé dans le classement synthétique traduit une meilleure maîtrise globale du parsing documentaire. Il faut toutefois distinguer cette présentation en pourcentage des métriques sous-jacentes : pour l’Overall Edit Distance, une valeur plus faible est préférable. La fiabilité du classement doit être interprétée avec prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant uniforme.
Parmi les 13 modèles recensés, MiniMax M3 arrive en tête à 92 %, contre une médiane de 89 %. Cet écart réduit suggère un classement resserré et une possible saturation au sommet, où quelques points peuvent séparer plusieurs systèmes. Le caractère public du jeu crée aussi un risque de contamination si son contenu intervient dans l’entraînement ou l’optimisation des modèles. Enfin, la portée reste celle du corpus évalué : pages PDF, catégories documentaires et structures de mise en page retenues, avec des contenus en anglais, en chinois simplifié et mixtes EN-ZH. OmniDocBench 1.5 renseigne donc précisément la performance documentaire couverte, sans constituer une mesure générale de toutes les capacités multimodales.
Sources des scores : llm-stats.