HealthBench
HealthBench est un benchmark créé par OpenAI en 2025 pour évaluer les modèles de langage dans des situations liées à la santé. Il repose sur des conversations médicales multi-tours, auxquelles les modèles produisent des réponses ensuite examinées selon des rubriques détaillées.
HealthBench est un benchmark créé par OpenAI en 2025 pour évaluer les modèles de langage dans des situations liées à la santé. Il repose sur des conversations médicales multi-tours, auxquelles les modèles produisent des réponses ensuite examinées selon des rubriques détaillées.
Le benchmark mesure conjointement la qualité, la sécurité et l’utilité des réponses. Il couvre notamment le raisonnement clinique, la communication avec le patient et l’adoption de comportements sûrs, afin de fournir un cadre commun d’évaluation des capacités des modèles dans différents contextes de santé.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | santé |
| Modalité | Texte |
| Type de questions | conversations médicales multi-tours avec réponses générées évaluées par rubriques |
| Métrique d'évaluation | score moyen basé sur des critères de rubrique, normalisé entre 0 et 1 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 5 000 conversations multi-tours et 48 562 critères de rubrique uniques |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2 0905 | Moonshot AI | 🔒 Propriétaire | 58,0 % | 5 septembre 2025 | Auto-déclaré |
| 2 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 57,6 % | 5 août 2025 | Auto-déclaré |
| 3 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 57,0 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 57,0 % | 9 juillet 2026 | Auto-déclaré |
| 5 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 55,8 % | 9 juillet 2026 | Auto-déclaré |
| 6 | GPT-5.3 Chat | OpenAI | 🔒 Propriétaire | 54,1 % | 4 mars 2026 | Auto-déclaré |
| 7 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 51,4 % | 5 mai 2026 | Auto-déclaré |
| 8 | GPT OSS 20B | OpenAI | 🟢 Ouvert | 42,5 % | 5 août 2025 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 56,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur HealthBench indique que les réponses satisfont davantage les critères définis dans les rubriques, en matière de raisonnement clinique, de communication, d’utilité et de sécurité. L’évaluation est structurée et approfondie, avec des réponses générées jugées à partir de critères uniques élaborés sur des conversations multi-tours et évalués par des médecins. Le score normalisé facilite la comparaison, mais sa portée reste celle de conversations en anglais et de comportements mesurés dans les contextes de santé couverts par le benchmark. Dans la base, les résultats sont majoritairement auto-déclarés par les éditeurs, ce qui limite leur homogénéité par rapport à une évaluation entièrement indépendante. Le classement porte en outre sur seulement cinq modèles. Kimi K2 0905 arrive en tête avec 58 %, contre une médiane de 54 %, ce qui montre un avantage mesuré mais contenu. Enfin, quatre des cinq modèles classés sont édités par OpenAI, également créateur du benchmark. Cette forte représentation rend la source peu indépendante pour comparer les modèles OpenAI à ceux d’autres éditeurs.
Sources des scores : llm-stats.