HealthBench Professional

HealthBench Professional est un benchmark créé par OpenAI pour évaluer les capacités et la sûreté des modèles d’IA dans des usages cliniques professionnels. Il repose sur des conversations en anglais reproduisant des échanges réels de cliniciens autour de cas médicaux.

HealthBench Professional est un benchmark créé par OpenAI pour évaluer les capacités et la sûreté des modèles d’IA dans des usages cliniques professionnels. Il repose sur des conversations en anglais reproduisant des échanges réels de cliniciens autour de cas médicaux.

Les modèles répondent librement à des situations de consultation, de rédaction clinique, de documentation et de recherche médicale. Leurs réponses sont évaluées à partir de rubriques conçues et arbitrées par des médecins, afin de mesurer leur adéquation aux exigences professionnelles plutôt qu’à de simples questions fermées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesÉvaluation de la capacité et de la sûreté des modèles pour des usages cliniques professionnels (consultation, rédaction/documentation, recherche médicale) à partir de conversations réelles de cliniciens
ModalitéTexte
Type de questionschat/réponse libre sur des cas cliniques réels
Métrique d'évaluationnotation selon des rubriques rédigées et arbitrées par des médecins
AccèsPublic
Languesanglais
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire66,0 %9 juin 2026Auto-déclaré
2GPT-5.6 SolOpenAI🔒 Propriétaire60,5 %9 juillet 2026Auto-déclaré
3Claude Sonnet 5Anthropic🔒 Propriétaire57,8 %30 juin 2026Auto-déclaré
4GPT-5.6 TerraOpenAI🔒 Propriétaire57,7 %9 juillet 2026Auto-déclaré
5Claude Opus 4.8Anthropic🔒 Propriétaire55,8 %28 mai 2026Auto-déclaré
6GPT-5.6 LunaOpenAI🔒 Propriétaire55,7 %9 juillet 2026Auto-déclaré
7GPT-5.5 InstantOpenAI🔒 Propriétaire38,4 %5 mai 2026Auto-déclaré
8MAI-Thinking-1Microsoft🔒 Propriétaire35,0 %2 juin 2026Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 56,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle satisfait plus largement les critères médicaux de capacité et de sûreté définis dans les rubriques. Cette méthode apporte une évaluation structurée et adaptée aux réponses libres, avec des critères rédigés et arbitrés par des médecins. La fiabilité comparative reste toutefois à nuancer, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de façon indépendante.

Le classement des cinq modèles montre une marge de progression notable : Claude Fable 5 arrive en tête à 66 %, tandis que la médiane s’établit à 56 %. Cet écart place le meilleur résultat au-dessus du niveau central sans indiquer de saturation du benchmark. La portée demeure centrée sur des conversations cliniques en anglais et sur trois familles d’usages professionnels. Enfin, l’accès public facilite l’évaluation, mais impose de considérer le risque de contamination lors de l’interprétation de performances futures, notamment si les contenus du benchmark sont intégrés aux processus d’entraînement ou d’optimisation.


Sources des scores : llm-stats.