MedXpertQA
MedXpertQA est un benchmark médical conçu en 2025 par le laboratoire C3I de l’Université Tsinghua. Il évalue les connaissances médicales et le raisonnement clinique de niveau expert à partir de questions issues d’examens médicaux spécialisés.
MedXpertQA est un benchmark médical conçu en 2025 par le laboratoire C3I de l’Université Tsinghua. Il évalue les connaissances médicales et le raisonnement clinique de niveau expert à partir de questions issues d’examens médicaux spécialisés.
Son dispositif associe un sous-ensemble textuel et un sous-ensemble multimodal, qui combine images médicales, dossiers patients et résultats d’examens. MedXpertQA sert ainsi à comparer la capacité des modèles à sélectionner une réponse correcte dans des situations cliniques riches, couvrant plusieurs spécialités et systèmes corporels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Université Tsinghua (laboratoire C3I) |
| Capacités mesurées | Connaissances médicales et raisonnement clinique de niveau expert, en texte et en multimodal (images + dossiers patients, résultats d'examens) |
| Modalité | Multimodal |
| Type de questions | Choix multiple (QCM d'examens médicaux experts) ; sous-ensembles Text et MM (multimodal) |
| Métrique d'évaluation | Accuracy par sous-ensemble |
| Accès | Public |
| Licence | MIT (dépôt code) ; article CC BY 4.0 |
| Langues | Anglais |
| Taille du jeu | 4 460 questions (17 spécialités, 11 systèmes corporels) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Muse Spark | Meta | 🔒 Propriétaire | 78,4 % | 8 avril 2026 | Auto-déclaré |
| 2 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,3 % | 24 février 2026 | Auto-déclaré |
| 3 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,4 % | 24 février 2026 | Auto-déclaré |
| 4 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 61,4 % | 24 février 2026 | Auto-déclaré |
| 5 | Gemma 4 31B | 🟢 Ouvert | 61,3 % | 2 avril 2026 | Auto-déclaré | |
| 6 | Gemma 4 26B-A4B | 🟢 Ouvert | 58,1 % | 2 avril 2026 | Auto-déclaré | |
| 7 | DiffusionGemma 26B-A4B | 🟢 Ouvert | 49,0 % | 10 juin 2026 | Auto-déclaré | |
| 8 | Gemma 4 12B | 🟢 Ouvert | 48,7 % | 23 mai 2026 | Auto-déclaré | |
| 9 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 43,0 % | 2 juin 2026 | Auto-déclaré |
| 10 | Gemma 4 E4B | 🟢 Ouvert | 28,7 % | 2 avril 2026 | Auto-déclaré | |
| 11 | Gemma 4 E2B | 🟢 Ouvert | 23,5 % | 2 avril 2026 | Auto-déclaré | |
| 12 | MedGemma 4B IT | 🟢 Ouvert | 18,8 % | 20 mai 2025 | Auto-déclaré |
Classement établi sur 12 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 53,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MedXpertQA indique qu’un modèle répond correctement à une forte proportion de QCM médicaux experts, aussi bien dans le sous-ensemble Text que dans le sous-ensemble MM. Il reflète donc une maîtrise conjointe des connaissances médicales, du raisonnement clinique et, pour la partie multimodale, de l’exploitation d’images et d’informations cliniques. L’accuracy reste toutefois une mesure de réponses correctes à des choix multiples en anglais, dans le périmètre des spécialités et systèmes couverts. Elle ne représente pas à elle seule l’ensemble des usages médicaux possibles.
Le classement de la base fait apparaître un écart marqué entre la médiane des douze modèles, fixée à 54 %, et Muse Spark (Meta), premier à 78 %. Ce résultat montre une nette avance sur l’ensemble évalué, sans indiquer une saturation complète du benchmark. La prudence reste nécessaire dans les comparaisons, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon une procédure indépendante commune. Cette modalité réduit la rigueur comparative et ne permet pas d’écarter, à elle seule, un risque de contamination des questions.
Sources des scores : llm-stats.