Internal API instruction following (hard)

Internal API instruction following (hard) est un benchmark créé par OpenAI pour évaluer le suivi d’instructions complexes inspirées de retours réels de développeurs. Il cible notamment le respect de contraintes portant sur le format des réponses, leur verbosité et leur longueur.

Internal API instruction following (hard) est un benchmark créé par OpenAI pour évaluer le suivi d’instructions complexes inspirées de retours réels de développeurs. Il cible notamment le respect de contraintes portant sur le format des réponses, leur verbosité et leur longueur.

Cette évaluation interne mesure la capacité d’un modèle à produire une réponse conforme à plusieurs exigences difficiles. Elle complète ainsi les tests centrés sur les connaissances ou le raisonnement en examinant une aptitude directement liée à l’exécution précise de consignes dans un contexte d’usage.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkOpenAI
Capacités mesuréesSuivi d'instructions difficiles issues de retours réels de développeurs, avec contraintes de format, verbosité et longueur
ModalitéTexte
Type de questionssuivi d'instructions (formatage, verbosité, longueur)
Métrique d'évaluationtaux de réussite / accuracy (évaluation interne, non détaillée)
AccèsJeu de test privé (réponses non divulguées)
Languesanglais (présumé)

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-5OpenAI🔒 Propriétaire64,0 %7 août 2025Auto-déclaré
2GPT-4.5OpenAI🔒 Propriétaire54,0 %5 mars 2026Auto-déclaré
3o3-miniOpenAI🔒 Propriétaire50,0 %30 janvier 2025Auto-déclaré
4GPT-4.1OpenAI🔒 Propriétaire49,1 %14 avril 2025Auto-déclaré
5GPT-4.1 miniOpenAI🔒 Propriétaire45,1 %14 avril 2025Auto-déclaré
6GPT-4.1 nanoOpenAI🔒 Propriétaire31,6 %14 avril 2025Auto-déclaré
7GPT-4oOpenAI🔒 Propriétaire29,2 %27 mars 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 49,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle respecte fréquemment les contraintes de formatage, de verbosité et de longueur imposées par ces instructions difficiles. Le meilleur résultat, 64 % pour GPT-5, comparé à une médiane de 49 %, montre une avance au sein du groupe évalué, mais aussi une marge d’échec encore substantielle. Ces niveaux ne suggèrent donc pas une saturation du benchmark parmi les sept modèles recensés.

La lecture des résultats appelle toutefois plusieurs réserves. L’accuracy provient d’une évaluation interne non détaillée et les scores sont majoritairement auto-déclarés par les éditeurs. Le jeu de test est privé et les réponses ne sont pas divulguées, ce qui restreint la vérification externe des résultats. Sa portée reste ciblée sur le suivi d’instructions en anglais présumé, selon trois familles de contraintes, et ne constitue pas une mesure générale des capacités d’un modèle. Enfin, les sept modèles classés sont édités par OpenAI, également créateur du benchmark. Le classement renseigne donc surtout sur les écarts internes à cette gamme et ne fournit pas une comparaison indépendante avec les modèles d’autres éditeurs.


Sources des scores : llm-stats.