HealthBench Professional
HealthBench Professional est un benchmark créé par OpenAI pour évaluer les capacités et la sûreté des modèles d’IA dans des usages cliniques professionnels. Il repose sur des conversations en anglais reproduisant des échanges réels de cliniciens autour de cas médicaux.
HealthBench Professional est un benchmark créé par OpenAI pour évaluer les capacités et la sûreté des modèles d’IA dans des usages cliniques professionnels. Il repose sur des conversations en anglais reproduisant des échanges réels de cliniciens autour de cas médicaux.
Les modèles répondent librement à des situations de consultation, de rédaction clinique, de documentation et de recherche médicale. Leurs réponses sont évaluées à partir de rubriques conçues et arbitrées par des médecins, afin de mesurer leur adéquation aux exigences professionnelles plutôt qu’à de simples questions fermées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | OpenAI |
| Capacités mesurées | Évaluation de la capacité et de la sûreté des modèles pour des usages cliniques professionnels (consultation, rédaction/documentation, recherche médicale) à partir de conversations réelles de cliniciens |
| Modalité | Texte |
| Type de questions | chat/réponse libre sur des cas cliniques réels |
| Métrique d'évaluation | notation selon des rubriques rédigées et arbitrées par des médecins |
| Accès | Public |
| Langues | anglais |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 66,0 % | 9 juin 2026 | Auto-déclaré |
| 2 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 60,5 % | 9 juillet 2026 | Auto-déclaré |
| 3 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 57,8 % | 30 juin 2026 | Auto-déclaré |
| 4 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 57,7 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 55,8 % | 28 mai 2026 | Auto-déclaré |
| 6 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 55,7 % | 9 juillet 2026 | Auto-déclaré |
| 7 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 38,4 % | 5 mai 2026 | Auto-déclaré |
| 8 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 35,0 % | 2 juin 2026 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 56,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle satisfait plus largement les critères médicaux de capacité et de sûreté définis dans les rubriques. Cette méthode apporte une évaluation structurée et adaptée aux réponses libres, avec des critères rédigés et arbitrés par des médecins. La fiabilité comparative reste toutefois à nuancer, car les résultats recensés sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de façon indépendante.
Le classement des cinq modèles montre une marge de progression notable : Claude Fable 5 arrive en tête à 66 %, tandis que la médiane s’établit à 56 %. Cet écart place le meilleur résultat au-dessus du niveau central sans indiquer de saturation du benchmark. La portée demeure centrée sur des conversations cliniques en anglais et sur trois familles d’usages professionnels. Enfin, l’accès public facilite l’évaluation, mais impose de considérer le risque de contamination lors de l’interprétation de performances futures, notamment si les contenus du benchmark sont intégrés aux processus d’entraînement ou d’optimisation.
Sources des scores : llm-stats.