HealthBench

HealthBench est un benchmark créé par OpenAI en 2025 pour évaluer les modèles de langage dans des situations liées à la santé. Il repose sur des conversations médicales multi-tours, auxquelles les modèles produisent des réponses ensuite examinées selon des rubriques détaillées.

HealthBench est un benchmark créé par OpenAI en 2025 pour évaluer les modèles de langage dans des situations liées à la santé. Il repose sur des conversations médicales multi-tours, auxquelles les modèles produisent des réponses ensuite examinées selon des rubriques détaillées.

Le benchmark mesure conjointement la qualité, la sécurité et l’utilité des réponses. Il couvre notamment le raisonnement clinique, la communication avec le patient et l’adoption de comportements sûrs, afin de fournir un cadre commun d’évaluation des capacités des modèles dans différents contextes de santé.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréessanté
ModalitéTexte
Type de questionsconversations médicales multi-tours avec réponses générées évaluées par rubriques
Métrique d'évaluationscore moyen basé sur des critères de rubrique, normalisé entre 0 et 1
AccèsPublic
Languesanglais
Taille du jeu5 000 conversations multi-tours et 48 562 critères de rubrique uniques
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2 0905Moonshot AI🔒 Propriétaire58,0 %5 septembre 2025Auto-déclaré
2GPT OSS 120BOpenAI🟢 Ouvert57,6 %5 août 2025Auto-déclaré
3GPT-5.6 SolOpenAI🔒 Propriétaire57,0 %9 juillet 2026Auto-déclaré
4GPT-5.6 TerraOpenAI🔒 Propriétaire57,0 %9 juillet 2026Auto-déclaré
5GPT-5.6 LunaOpenAI🔒 Propriétaire55,8 %9 juillet 2026Auto-déclaré
6GPT-5.3 ChatOpenAI🔒 Propriétaire54,1 %4 mars 2026Auto-déclaré
7GPT-5.5 InstantOpenAI🔒 Propriétaire51,4 %5 mai 2026Auto-déclaré
8GPT OSS 20BOpenAI🟢 Ouvert42,5 %5 août 2025Auto-déclaré

Classement établi sur 8 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 56,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur HealthBench indique que les réponses satisfont davantage les critères définis dans les rubriques, en matière de raisonnement clinique, de communication, d’utilité et de sécurité. L’évaluation est structurée et approfondie, avec des réponses générées jugées à partir de critères uniques élaborés sur des conversations multi-tours et évalués par des médecins. Le score normalisé facilite la comparaison, mais sa portée reste celle de conversations en anglais et de comportements mesurés dans les contextes de santé couverts par le benchmark. Dans la base, les résultats sont majoritairement auto-déclarés par les éditeurs, ce qui limite leur homogénéité par rapport à une évaluation entièrement indépendante. Le classement porte en outre sur seulement cinq modèles. Kimi K2 0905 arrive en tête avec 58 %, contre une médiane de 54 %, ce qui montre un avantage mesuré mais contenu. Enfin, quatre des cinq modèles classés sont édités par OpenAI, également créateur du benchmark. Cette forte représentation rend la source peu indépendante pour comparer les modèles OpenAI à ceux d’autres éditeurs.


Sources des scores : llm-stats.