Hallusion Bench
Hallusion Bench est un benchmark public créé en 2023 par Tianyi Guan et ses coauteurs pour évaluer le raisonnement multimodal associant images et contexte textuel. Il confronte les grands modèles vision-langage à des questions en anglais appelant une réponse par oui ou non.
Hallusion Bench est un benchmark public créé en 2023 par Tianyi Guan et ses coauteurs pour évaluer le raisonnement multimodal associant images et contexte textuel. Il confronte les grands modèles vision-langage à des questions en anglais appelant une réponse par oui ou non.
Son objectif est d’examiner la capacité des modèles à interpréter correctement une scène tout en résistant aux hallucinations linguistiques et aux illusions visuelles. Il sert ainsi à comparer leur robustesse lorsque les informations visuelles et textuelles peuvent favoriser une réponse erronée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Tianyi Guan et al. |
| Capacités mesurées | raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | questions oui/non sur image et contexte textuel |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 346 images et 1 129 questions |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (16)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,0 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,8 % | 16 avril 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,9 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,6 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,4 % | 22 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,7 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,0 % | 22 septembre 2025 | Auto-déclaré |
| 8 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,4 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,1 % | 22 septembre 2025 | Auto-déclaré |
| 10 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,8 % | 22 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,2 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,5 % | 22 septembre 2025 | Auto-déclaré |
| 13 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,1 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 57,6 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen2.5 VL 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 55,2 % | 26 janvier 2025 | Auto-déclaré |
| 16 | Qwen2.5 VL 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,9 % | 26 janvier 2025 | Auto-déclaré |
Classement établi sur 16 modèles évalués. Score médian de l'ensemble : 64,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Hallusion Bench correspond à une plus grande proportion de réponses exactes. Il traduit donc une meilleure aptitude à articuler image et contexte textuel, ainsi qu’à éviter les pièges liés aux hallucinations linguistiques et aux illusions visuelles. La comparaison doit toutefois rester prudente, car les résultats de la base sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante unique.
Parmi les 16 modèles évalués, le score médian atteint 65 %, tandis que Qwen3.5-27B arrive en tête à 70 %. Cet écart limité entre la médiane et le meilleur résultat suggère un classement relativement resserré, ce qui réduit la portée pratique de faibles différences de score et peut signaler un pouvoir de séparation modéré dans cette zone. L’accès public peut aussi exposer l’évaluation à un risque de contamination. Enfin, la portée du benchmark reste circonscrite au raisonnement image-texte en anglais, sous forme de questions oui/non. Il ne résume donc pas à lui seul l’ensemble des capacités d’un modèle multimodal.
Sources des scores : llm-stats.