OmniDocBench 1.5

OmniDocBench 1.5 est un benchmark créé par OpenDataLab pour évaluer la compréhension et le parsing de documents par les grands modèles multimodaux. Il couvre notamment l’OCR, l’extraction d’information, l’analyse de la mise en page, les tables, les formules et la réponse à des questions…

OmniDocBench 1.5 est un benchmark créé par OpenDataLab pour évaluer la compréhension et le parsing de documents par les grands modèles multimodaux. Il couvre notamment l’OCR, l’extraction d’information, l’analyse de la mise en page, les tables, les formules et la réponse à des questions visuelles.

L’évaluation porte sur le traitement bout-en-bout de pages PDF, jusqu’à la restitution de leur ordre de lecture. Des métriques spécialisées mesurent chaque composante, tandis que l’appariement Hybrid Matching introduit dans cette version vise à affiner la comparaison des sorties.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenDataLab
Capacités mesuréesCompréhension et parsing de documents pour LMM : OCR, extraction d'information, mise en page, tables, formules, VQA, ordre de lecture
ModalitéMultimodal
Type de questionsParsing de documents bout-en-bout (OCR, détection de mise en page, reconnaissance de tables/formules, ordre de lecture)
Métrique d'évaluationNormalized Edit Distance, BLEU, METEOR, TEDS, COCODet (mAP/mAR), CDM ; v1.5 introduit un appariement hybride (Hybrid Matching)
AccèsPublic
LicenceApache-2.0
LanguesAnglais, chinois simplifié, mixte EN-ZH
Taille du jeu1 651 pages PDF (v1.5), 10 types de documents, 5 types de mise en page, 5 langues
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1MiniMax M3MiniMax🟢 Ouvert91,6 %1 juin 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire91,4 %31 mai 2026Auto-déclaré
3Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire91,2 %31 mars 2026Auto-déclaré
4Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert89,9 %16 avril 2026Auto-déclaré
5Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert89,8 %24 février 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert89,3 %24 février 2026Auto-déclaré
7GPT-4.5OpenAI🔒 Propriétaire89,1 %5 mars 2026Auto-déclaré
8Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert88,9 %24 février 2026Auto-déclaré
9Kimi K2.5Moonshot AI🟢 Ouvert88,8 %27 janvier 2026Auto-déclaré
10GPT-5.5 InstantOpenAI🔒 Propriétaire87,5 %5 mai 2026Auto-déclaré
11GPT-5.4 miniOpenAI🔒 Propriétaire87,4 %17 mars 2026Auto-déclaré
12GPT-5.4 nanoOpenAI🔒 Propriétaire75,8 %17 mars 2026Auto-déclaré
13Gemma 4 12BGoogle🟢 Ouvert16,4 %23 mai 2026Auto-déclaré

Classement établi sur 13 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 89,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé dans le classement synthétique traduit une meilleure maîtrise globale du parsing documentaire. Il faut toutefois distinguer cette présentation en pourcentage des métriques sous-jacentes : pour l’Overall Edit Distance, une valeur plus faible est préférable. La fiabilité du classement doit être interprétée avec prudence, car les résultats sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant uniforme.

Parmi les 13 modèles recensés, MiniMax M3 arrive en tête à 92 %, contre une médiane de 89 %. Cet écart réduit suggère un classement resserré et une possible saturation au sommet, où quelques points peuvent séparer plusieurs systèmes. Le caractère public du jeu crée aussi un risque de contamination si son contenu intervient dans l’entraînement ou l’optimisation des modèles. Enfin, la portée reste celle du corpus évalué : pages PDF, catégories documentaires et structures de mise en page retenues, avec des contenus en anglais, en chinois simplifié et mixtes EN-ZH. OmniDocBench 1.5 renseigne donc précisément la performance documentaire couverte, sans constituer une mesure générale de toutes les capacités multimodales.


Sources des scores : llm-stats.