SlakeVQA

SlakeVQA est un benchmark de visual question answering médical créé par Bo Liu et ses coauteurs en 2021. Il associe des images radiologiques à des questions ouvertes et à des réponses courtes en anglais et en chinois, avec des annotations réalisées par des médecins expérimentés.

SlakeVQA est un benchmark de visual question answering médical créé par Bo Liu et ses coauteurs en 2021. Il associe des images radiologiques à des questions ouvertes et à des réponses courtes en anglais et en chinois, avec des annotations réalisées par des médecins expérimentés.

Son objectif est d’évaluer la compréhension conjointe des contenus visuels et textuels par les modèles. Il teste aussi leur capacité à mobiliser des connaissances médicales externes, grâce à des questions fondées uniquement sur l’image ou exigeant un raisonnement enrichi par une base de connaissances structurée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBo Liu et al.
Capacités mesuréessanté, image vers texte, multimodal, raisonnement, vision
ModalitéMultimodal
Type de questionsquestions ouvertes de visual question answering médical, avec réponses courtes bilingues
Métrique d'évaluationaccuracy
AccèsPublic
Languesanglais et chinois
Taille du jeu642 images radiologiques et 14 028 paires question-réponse
Année de publication2021
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (4)

#ModèleÉditeurScoreSortieFiabilité
1Qwen3.5-122B-A10BQwen81,6 %24 février 2026Auto-déclaré
2Qwen3.5-27BQwen80,0 %24 février 2026Auto-déclaré
3Qwen3.5-35B-A3BQwen78,7 %24 février 2026Auto-déclaré
4MedGemma 4B ITGoogle62,3 %20 mai 2025Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 79,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SlakeVQA indique qu’un modèle fournit fréquemment la réponse attendue à partir d’une image radiologique et d’une question, y compris lorsque des connaissances médicales externes sont nécessaires. L’accuracy offre une mesure directe, mais ne décrit pas séparément les performances selon la langue, le type d’image ou la nature du raisonnement. La portée reste circonscrite au visual question answering sur des scanners, IRM et radiographies couvrant cinq parties du corps, avec des réponses courtes bilingues. Le caractère public du jeu appelle aussi à considérer le risque de contamination lors de l’interprétation des résultats. Dans la base, quatre modèles sont évalués et les scores sont majoritairement auto-déclarés par leurs éditeurs, ce qui rend leur comparabilité moins rigoureuse qu’une évaluation indépendante menée dans un cadre uniforme. Avec une médiane de 79 % et Qwen3.5-122B-A10B en tête à 82 %, le classement montre un écart limité entre le niveau central et le meilleur résultat. Cette proximité peut signaler une saturation partielle parmi les modèles recensés, sans suffire à établir une maîtrise générale du raisonnement médical multimodal.


Sources des scores : llm-stats.