HealthBench Consensus
HealthBench Consensus est un sous-ensemble de HealthBench consacré aux conversations de santé pour lesquelles les critères d’évaluation font l’objet d’un accord particulièrement élevé. Ces critères, créés par des médecins, fournissent un cadre de référence fondé sur un consensus…
HealthBench Consensus est un sous-ensemble de HealthBench consacré aux conversations de santé pour lesquelles les critères d’évaluation font l’objet d’un accord particulièrement élevé. Ces critères, créés par des médecins, fournissent un cadre de référence fondé sur un consensus professionnel.
Le benchmark mesure les performances et la sécurité des modèles d’IA dans des échanges liés aux soins. Son rôle consiste à comparer leur capacité à produire des réponses conformes à des attentes médicales consensuelles, sur un périmètre où l’évaluation se veut moins ambiguë.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Capacités mesurées | santé |
| Modalité | Texte |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 95,5 % | 9 juillet 2026 | Auto-déclaré |
| 2 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 95,1 % | 9 juillet 2026 | Auto-déclaré |
| 3 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 95,1 % | 9 juillet 2026 | Auto-déclaré |
| 4 | GPT-5.5 Instant | OpenAI | 🔒 Propriétaire | 94,7 % | 5 mai 2026 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 95,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique une forte conformité aux critères établis par les médecins sur les conversations retenues. Il reflète donc une bonne performance dans ce cadre précis, sans constituer à lui seul une mesure générale de toutes les compétences médicales ou de tous les usages en santé. La médiane très élevée et l’écart d’un point seulement avec le meilleur résultat suggèrent une saturation du benchmark, qui limite sa capacité à départager finement les modèles les plus performants. GPT-5.6 Sol arrive en tête, mais son avance reste étroite au regard du niveau d’ensemble. La fiabilité appelle aussi à la prudence, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant commun. Une éventuelle contamination des données d’entraînement par les conversations ou les critères réduirait également la portée des résultats, sans être déductible du score seul. Le classement renseigne surtout sur l’adhésion à des critères consensuels, dans le sous-ensemble ciblé par HealthBench Consensus.
Sources des scores : llm-stats.