Hallusion Bench

Hallusion Bench est un benchmark public créé en 2023 par Tianyi Guan et ses coauteurs pour évaluer le raisonnement multimodal associant images et contexte textuel. Il confronte les grands modèles vision-langage à des questions en anglais appelant une réponse par oui ou non.

Hallusion Bench est un benchmark public créé en 2023 par Tianyi Guan et ses coauteurs pour évaluer le raisonnement multimodal associant images et contexte textuel. Il confronte les grands modèles vision-langage à des questions en anglais appelant une réponse par oui ou non.

Son objectif est d’examiner la capacité des modèles à interpréter correctement une scène tout en résistant aux hallucinations linguistiques et aux illusions visuelles. Il sert ainsi à comparer leur robustesse lorsque les informations visuelles et textuelles peuvent favoriser une réponse erronée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkTianyi Guan et al.
Capacités mesuréesraisonnement, vision
ModalitéMultimodal
Type de questionsquestions oui/non sur image et contexte textuel
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais
Taille du jeu346 images et 1 129 questions
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (16)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert70,0 %24 février 2026Auto-déclaré
2Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert69,8 %16 avril 2026Auto-déclaré
3Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert67,9 %24 février 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert67,6 %24 février 2026Auto-déclaré
5Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert67,4 %22 septembre 2025Auto-déclaré
6Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert66,7 %22 septembre 2025Auto-déclaré
7Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert66,0 %22 septembre 2025Auto-déclaré
8Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert65,4 %22 septembre 2025Auto-déclaré
9Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert64,1 %22 septembre 2025Auto-déclaré
10Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,8 %22 septembre 2025Auto-déclaré
11Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,2 %22 septembre 2025Auto-déclaré
12Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,5 %22 septembre 2025Auto-déclaré
13Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert61,1 %22 septembre 2025Auto-déclaré
14Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert57,6 %22 septembre 2025Auto-déclaré
15Qwen2.5 VL 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert55,2 %26 janvier 2025Auto-déclaré
16Qwen2.5 VL 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert52,9 %26 janvier 2025Auto-déclaré

Classement établi sur 16 modèles évalués. Score médian de l'ensemble : 64,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur Hallusion Bench correspond à une plus grande proportion de réponses exactes. Il traduit donc une meilleure aptitude à articuler image et contexte textuel, ainsi qu’à éviter les pièges liés aux hallucinations linguistiques et aux illusions visuelles. La comparaison doit toutefois rester prudente, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.

Parmi les 16 modèles évalués, le score médian atteint 65 %, tandis que Qwen3.5-27B arrive en tête à 70 %. Cet écart limité entre la médiane et le meilleur résultat suggère un classement relativement resserré, ce qui réduit la portée pratique de faibles différences de score et peut signaler un pouvoir de séparation modéré dans cette zone. L’accès public peut aussi exposer l’évaluation à un risque de contamination. Enfin, la portée du benchmark reste circonscrite au raisonnement image-texte en anglais, sous forme de questions oui/non. Il ne résume donc pas à lui seul l’ensemble des capacités d’un modèle multimodal.


Sources des scores : llm-stats.