HealthBench Hard
HealthBench Hard est une déclinaison exigeante de HealthBench, créée par OpenAI pour évaluer la performance et la sécurité des grands modèles de langage dans le domaine de la santé. Elle repose sur des conversations multi-tours portant sur des situations cliniques complexes ou ambiguës.
HealthBench Hard est une déclinaison exigeante de HealthBench, créée par OpenAI pour évaluer la performance et la sécurité des grands modèles de langage dans le domaine de la santé. Elle repose sur des conversations multi-tours portant sur des situations cliniques complexes ou ambiguës.
Le benchmark examine notamment l’exactitude, la qualité de la communication, la recherche du contexte pertinent et la complétude des réponses. L’évaluation s’appuie sur des rubriques conçues par des médecins, puis notées par un modèle juge, afin de comparer la capacité des modèles à produire des réponses adaptées à des cas difficiles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Performance et sécurité en santé sur cas cliniquement complexes et ambigus ; exactitude, communication, recherche de contexte, complétude |
| Modalité | Texte |
| Type de questions | conversations santé multi-tours, évaluation par rubriques rédigées par des médecins |
| Métrique d'évaluation | score agrégé sur rubriques notées par un modèle juge (critères créés par des médecins) |
| Accès | Public |
| Langues | anglais (principalement) |
| Taille du jeu | 1000 exemples (sous-ensemble difficile de HealthBench) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (9)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Muse Spark | Meta | 🔒 Propriétaire | 42,8 % | 8 avril 2026 | Auto-déclaré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 33,1 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 32,7 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 32,0 % | 9 juillet 2026 | Auto-déclaré |
| 5 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 30,0 % | 5 août 2025 | Auto-déclaré |
| 6 | GPT-5.3 Chat | OpenAI | 🔒 Propriétaire | 25,9 % | 4 mars 2026 | Auto-déclaré |
| 7 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 22,9 % | 5 mai 2026 | Auto-déclaré |
| 8 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 10,8 % | 5 août 2025 | Auto-déclaré |
| 9 | GPT-5 | OpenAI | 🔒 Propriétaire | 1,6 % | 7 août 2025 | Auto-déclaré |
Classement établi sur 9 modèles évalués, dont 9 de grands éditeurs. Score médian de l'ensemble : 30,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle satisfait plus largement les critères médicaux associés à chaque conversation, notamment en matière d’exactitude, de sécurité, de communication, de prise en compte du contexte et de complétude. Les rubriques ont été créées par des médecins, avec des critères rigoureux validés par 262 praticiens de 60 pays. La notation reste toutefois automatisée par un modèle juge et les résultats de la base sont majoritairement auto-déclarés par les éditeurs, ce qui limite leur indépendance de mesure.
Le meilleur résultat, obtenu par Muse Spark à 43 %, face à une médiane de 24 %, suggère que ce sous-ensemble difficile reste loin de la saturation. Son accès public peut aussi accroître le risque de contamination au fil du temps. Sa portée demeure ciblée sur des conversations de santé complexes, principalement en anglais, et ne résume donc pas à elle seule les capacités médicales générales d’un modèle. Enfin, cinq des six modèles classés sont édités par OpenAI, également créateur du benchmark. Ce classement ne constitue donc pas une source indépendante pour comparer les modèles OpenAI à ceux d’autres éditeurs.
Sources des scores : llm-stats.