MMLongBench-Doc

MMLongBench-Doc est un benchmark créé par THU-KEG et al. pour évaluer la compréhension de documents longs par les modèles vision-langage. Il repose sur des questions ouvertes à réponse courte portant sur des PDF riches en contenu visuel.

MMLongBench-Doc est un benchmark créé par THU-KEG et al. pour évaluer la compréhension de documents longs par les modèles vision-langage. Il repose sur des questions ouvertes à réponse courte portant sur des PDF riches en contenu visuel.

Son évaluation mobilise conjointement le texte, la mise en page, les tableaux, les figures et des informations dispersées sur de nombreuses pages. Il sert ainsi à mesurer la capacité d’un modèle à intégrer plusieurs formes d’information dans un contexte documentaire étendu.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTHU-KEG et al.
Capacités mesuréescontexte long, multimodal, vision
ModalitéImage
Type de questionsquestions ouvertes à réponse courte sur des documents PDF longs avec contenu visuel
Métrique d'évaluationaccuracy, avec évaluation automatisée des réponses par juge LLM
AccèsPublic
Languesanglais
Taille du jeu1 082 questions sur 135 documents PDF
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire62,0 %31 mars 2026Auto-déclaré
2Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert60,2 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert59,5 %24 février 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert59,0 %24 février 2026Auto-déclaré
5Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert56,2 %22 septembre 2025Auto-déclaré

Classement établi sur 5 modèles évalués. Score médian de l'ensemble : 59,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MMLongBench-Doc traduit une meilleure aptitude à extraire, relier et raisonner sur des informations textuelles et visuelles réparties dans de longs PDF. L’accuracy fournit une mesure directe des réponses correctes, mais leur validation repose sur un juge LLM automatisé. La lecture des résultats appelle aussi à la prudence, car les scores de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun.

Le classement est resserré parmi les cinq modèles évalués : Qwen3.6 Plus atteint 62 %, contre une médiane de 60 %. Cet écart limité indique une faible séparation entre le meilleur résultat et le centre de l’ensemble, sans suffire à établir une saturation générale du benchmark. La portée reste ciblée sur des questions courtes en anglais et sur la compréhension multimodale de documents PDF. Enfin, son accès public crée un risque potentiel d’exposition des données aux modèles, ce qui doit être pris en compte lors de l’interprétation comparative des scores.


Sources des scores : llm-stats.