SlakeVQA
SlakeVQA est un benchmark de visual question answering médical créé par Bo Liu et ses coauteurs en 2021. Il associe des images radiologiques à des questions ouvertes et à des réponses courtes en anglais et en chinois, avec des annotations réalisées par des médecins expérimentés.
SlakeVQA est un benchmark de visual question answering médical créé par Bo Liu et ses coauteurs en 2021. Il associe des images radiologiques à des questions ouvertes et à des réponses courtes en anglais et en chinois, avec des annotations réalisées par des médecins expérimentés.
Son objectif est d’évaluer la compréhension conjointe des contenus visuels et textuels par les modèles. Il teste aussi leur capacité à mobiliser des connaissances médicales externes, grâce à des questions fondées uniquement sur l’image ou exigeant un raisonnement enrichi par une base de connaissances structurée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Bo Liu et al. |
| Capacités mesurées | santé, image vers texte, multimodal, raisonnement, vision |
| Modalité | Multimodal |
| Type de questions | questions ouvertes de visual question answering médical, avec réponses courtes bilingues |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Langues | anglais et chinois |
| Taille du jeu | 642 images radiologiques et 14 028 paires question-réponse |
| Année de publication | 2021 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (4)
| # | Modèle | Éditeur | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|
| 1 | Qwen3.5-122B-A10B | Qwen | 81,6 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.5-27B | Qwen | 80,0 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-35B-A3B | Qwen | 78,7 % | 24 février 2026 | Auto-déclaré |
| 4 | MedGemma 4B IT | 62,3 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 79,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SlakeVQA indique qu’un modèle fournit fréquemment la réponse attendue à partir d’une image radiologique et d’une question, y compris lorsque des connaissances médicales externes sont nécessaires. L’accuracy offre une mesure directe, mais ne décrit pas séparément les performances selon la langue, le type d’image ou la nature du raisonnement. La portée reste circonscrite au visual question answering sur des scanners, IRM et radiographies couvrant cinq parties du corps, avec des réponses courtes bilingues. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Dans la base, quatre modèles sont évalués et les scores sont majoritairement auto-déclarés par leurs éditeurs, ce qui rend leur comparabilité moins rigoureuse qu’une évaluation indépendante menée dans un cadre uniforme. Avec une médiane de 79 % et Qwen3.5-122B-A10B en tête à 82 %, le classement montre un écart limité entre le niveau central et le meilleur résultat. Cette proximité peut signaler une saturation partielle parmi les modèles recensés, sans suffire à établir une maîtrise générale du raisonnement médical multimodal.
Sources des scores : llm-stats.