MedXpertQA

MedXpertQA est un benchmark médical conçu en 2025 par le laboratoire C3I de l’Université Tsinghua. Il évalue les connaissances médicales et le raisonnement clinique de niveau expert à partir de questions issues d’examens médicaux spécialisés.

MedXpertQA est un benchmark médical conçu en 2025 par le laboratoire C3I de l’Université Tsinghua. Il évalue les connaissances médicales et le raisonnement clinique de niveau expert à partir de questions issues d’examens médicaux spécialisés.

Son dispositif associe un sous-ensemble textuel et un sous-ensemble multimodal, qui combine images médicales, dossiers patients et résultats d’examens. MedXpertQA sert ainsi à comparer la capacité des modèles à sélectionner une réponse correcte dans des situations cliniques riches, couvrant plusieurs spécialités et systèmes corporels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUniversité Tsinghua (laboratoire C3I)
Capacités mesuréesConnaissances médicales et raisonnement clinique de niveau expert, en texte et en multimodal (images + dossiers patients, résultats d'examens)
ModalitéMultimodal
Type de questionsChoix multiple (QCM d'examens médicaux experts) ; sous-ensembles Text et MM (multimodal)
Métrique d'évaluationAccuracy par sous-ensemble
AccèsPublic
LicenceMIT (dépôt code) ; article CC BY 4.0
LanguesAnglais
Taille du jeu4 460 questions (17 spécialités, 11 systèmes corporels)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Muse SparkMeta🔒 Propriétaire78,4 %8 avril 2026Auto-déclaré
2Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert67,3 %24 février 2026Auto-déclaré
3Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert62,4 %24 février 2026Auto-déclaré
4Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert61,4 %24 février 2026Auto-déclaré
5Gemma 4 31BGoogle🟢 Ouvert61,3 %2 avril 2026Auto-déclaré
6Gemma 4 26B-A4BGoogle🟢 Ouvert58,1 %2 avril 2026Auto-déclaré
7DiffusionGemma 26B-A4BGoogle🟢 Ouvert49,0 %10 juin 2026Auto-déclaré
8Gemma 4 12BGoogle🟢 Ouvert48,7 %23 mai 2026Auto-déclaré
9MAI-Thinking-1Microsoft🔒 Propriétaire43,0 %2 juin 2026Auto-déclaré
10Gemma 4 E4BGoogle🟢 Ouvert28,7 %2 avril 2026Auto-déclaré
11Gemma 4 E2BGoogle🟢 Ouvert23,5 %2 avril 2026Auto-déclaré
12MedGemma 4B ITGoogle🟢 Ouvert18,8 %20 mai 2025Auto-déclaré

Classement établi sur 12 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 53,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MedXpertQA indique qu’un modèle répond correctement à une forte proportion de QCM médicaux experts, aussi bien dans le sous-ensemble Text que dans le sous-ensemble MM. Il reflète donc une maîtrise conjointe des connaissances médicales, du raisonnement clinique et, pour la partie multimodale, de l’exploitation d’images et d’informations cliniques. L’accuracy reste toutefois une mesure de réponses correctes à des choix multiples en anglais, dans le périmètre des spécialités et systèmes couverts. Elle ne représente pas à elle seule l’ensemble des usages médicaux possibles.

Le classement de la base fait apparaître un écart marqué entre la médiane des douze modèles, fixée à 54 %, et Muse Spark (Meta), premier à 78 %. Ce résultat montre une nette avance sur l’ensemble évalué, sans indiquer une saturation complète du benchmark. La prudence reste nécessaire dans les comparaisons, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Cette modalité réduit la rigueur comparative et ne permet pas d’écarter, à elle seule, un risque de contamination des questions.


Sources des scores : llm-stats.