HealthBench Hard

HealthBench Hard est une déclinaison exigeante de HealthBench, créée par OpenAI pour évaluer la performance et la sécurité des grands modèles de langage dans le domaine de la santé. Elle repose sur des conversations multi-tours portant sur des situations cliniques complexes ou ambiguës.

HealthBench Hard est une déclinaison exigeante de HealthBench, créée par OpenAI pour évaluer la performance et la sécurité des grands modèles de langage dans le domaine de la santé. Elle repose sur des conversations multi-tours portant sur des situations cliniques complexes ou ambiguës.

Le benchmark examine notamment l’exactitude, la qualité de la communication, la recherche du contexte pertinent et la complétude des réponses. L’évaluation s’appuie sur des rubriques conçues par des médecins, puis notées par un modèle juge, afin de comparer la capacité des modèles à produire des réponses adaptées à des cas difficiles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesPerformance et sécurité en santé sur cas cliniquement complexes et ambigus ; exactitude, communication, recherche de contexte, complétude
ModalitéTexte
Type de questionsconversations santé multi-tours, évaluation par rubriques rédigées par des médecins
Métrique d'évaluationscore agrégé sur rubriques notées par un modèle juge (critères créés par des médecins)
AccèsPublic
Languesanglais (principalement)
Taille du jeu1000 exemples (sous-ensemble difficile de HealthBench)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (9)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Muse SparkMeta🔒 Propriétaire42,8 %8 avril 2026Auto-déclaré
2GPT-5.6 SolOpenAI🔒 Propriétaire33,1 %9 juillet 2026Auto-déclaré
3GPT-5.6 TerraOpenAI🔒 Propriétaire32,7 %9 juillet 2026Auto-déclaré
4GPT-5.6 LunaOpenAI🔒 Propriétaire32,0 %9 juillet 2026Auto-déclaré
5GPT OSS 120BOpenAI🟢 Ouvert30,0 %5 août 2025Auto-déclaré
6GPT-5.3 ChatOpenAI🔒 Propriétaire25,9 %4 mars 2026Auto-déclaré
7GPT-5.5 InstantOpenAI🔒 Propriétaire22,9 %5 mai 2026Auto-déclaré
8GPT OSS 20BOpenAI🟢 Ouvert10,8 %5 août 2025Auto-déclaré
9GPT-5OpenAI🔒 Propriétaire1,6 %7 août 2025Auto-déclaré

Classement établi sur 9 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 30,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle satisfait plus largement les critères médicaux associés à chaque conversation, notamment en matière d’exactitude, de sécurité, de communication, de prise en compte du contexte et de complétude. Les rubriques ont été créées par des médecins, avec des critères rigoureux validés par 262 praticiens de 60 pays. La notation reste toutefois automatisée par un modèle juge et les résultats de la base sont majoritairement auto-déclarés par les éditeurs, ce qui limite leur indépendance de mesure.

Le meilleur résultat, obtenu par Muse Spark à 43 %, face à une médiane de 24 %, suggère que ce sous-ensemble difficile reste loin de la saturation. Son accès public peut aussi accroître le risque de contamination au fil du temps. Sa portée demeure ciblée sur des conversations de santé complexes, principalement en anglais, et ne résume donc pas à elle seule les capacités médicales générales d’un modèle. Enfin, cinq des six modèles classés sont édités par OpenAI, également créateur du benchmark. Ce classement ne constitue donc pas une source indépendante pour comparer les modèles OpenAI à ceux d’autres éditeurs.


Sources des scores : llm-stats.