MMLongBench-Doc
MMLongBench-Doc est un benchmark créé par THU-KEG et al. pour évaluer la compréhension de documents longs par les modèles vision-langage. Il repose sur des questions ouvertes à réponse courte portant sur des PDF riches en contenu visuel.
MMLongBench-Doc est un benchmark créé par THU-KEG et al. pour évaluer la compréhension de documents longs par les modèles vision-langage. Il repose sur des questions ouvertes à réponse courte portant sur des PDF riches en contenu visuel.
Son évaluation mobilise conjointement le texte, la mise en page, les tableaux, les figures et des informations dispersées sur de nombreuses pages. Il sert ainsi à mesurer la capacité d’un modèle à intégrer plusieurs formes d’information dans un contexte documentaire étendu.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | THU-KEG et al. |
| Capacités mesurées | contexte long, multimodal, vision |
| Modalité | Image |
| Type de questions | questions ouvertes à réponse courte sur des documents PDF longs avec contenu visuel |
| Métrique d'évaluation | accuracy, avec évaluation automatisée des réponses par juge LLM |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1 082 questions sur 135 documents PDF |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 62,0 % | 31 mars 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,2 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,5 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,0 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,2 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 59,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MMLongBench-Doc traduit une meilleure aptitude à extraire, relier et raisonner sur des informations textuelles et visuelles réparties dans de longs PDF. L’accuracy fournit une mesure directe des réponses correctes, mais leur validation repose sur un juge LLM automatisé. La lecture des résultats appelle aussi à la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun.
Le classement est resserré parmi les cinq modèles évalués : Qwen3.6 Plus atteint 62 %, contre une médiane de 60 %. Cet écart limité indique une faible séparation entre le meilleur résultat et le centre de l’ensemble, sans suffire à établir une saturation générale du benchmark. La portée reste ciblée sur des questions courtes en anglais et sur la compréhension multimodale de documents PDF. Enfin, son accès public crée un risque potentiel d’exposition des données aux modèles, ce qui doit être pris en compte lors de l’interprétation comparative des scores.
Sources des scores : llm-stats.