HealthBench Consensus

HealthBench Consensus est un sous-ensemble de HealthBench consacré aux conversations de santé pour lesquelles les critères d’évaluation font l’objet d’un accord particulièrement élevé. Ces critères, créés par des médecins, fournissent un cadre de référence fondé sur un consensus…

HealthBench Consensus est un sous-ensemble de HealthBench consacré aux conversations de santé pour lesquelles les critères d’évaluation font l’objet d’un accord particulièrement élevé. Ces critères, créés par des médecins, fournissent un cadre de référence fondé sur un consensus professionnel.

Le benchmark mesure les performances et la sécurité des modèles d’IA dans des échanges liés aux soins. Son rôle consiste à comparer leur capacité à produire des réponses conformes à des attentes médicales consensuelles, sur un périmètre où l’évaluation se veut moins ambiguë.

Carte d'identité

CaractéristiqueValeur
Capacités mesuréessanté
ModalitéTexte

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5.6 SolOpenAI🔒 Propriétaire95,5 %9 juillet 2026Auto-déclaré
2GPT-5.6 LunaOpenAI🔒 Propriétaire95,1 %9 juillet 2026Auto-déclaré
3GPT-5.6 TerraOpenAI🔒 Propriétaire95,1 %9 juillet 2026Auto-déclaré
4GPT-5.5 InstantOpenAI🔒 Propriétaire94,7 %5 mai 2026Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 95,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique une forte conformité aux critères établis par les médecins sur les conversations retenues. Il reflète donc une bonne performance dans ce cadre précis, sans constituer à lui seul une mesure générale de toutes les compétences médicales ou de tous les usages en santé. La médiane très élevée et l’écart d’un point seulement avec le meilleur résultat suggèrent une saturation du benchmark, qui limite sa capacité à départager finement les modèles les plus performants. GPT-5.6 Sol arrive en tête, mais son avance reste étroite au regard du niveau d’ensemble. La fiabilité appelle aussi à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Une éventuelle contamination des données d’entraînement par les conversations ou les critères réduirait également la portée des résultats, sans être déductible du score seul. Le classement renseigne surtout sur l’adhésion à des critères consensuels, dans le sous-ensemble ciblé par HealthBench Consensus.


Sources des scores : llm-stats.