IFBench

IFBench est un benchmark conçu par l’Allen Institute for AI (AI2) et l’University of Washington pour évaluer la capacité des modèles à suivre des instructions complexes. Il s’appuie sur des prompts en anglais issus d’un ensemble WildChat tenu à l’écart.

IFBench est un benchmark conçu par l’Allen Institute for AI (AI2) et l’University of Washington pour évaluer la capacité des modèles à suivre des instructions complexes. Il s’appuie sur des prompts en anglais issus d’un ensemble WildChat tenu à l’écart.

L’évaluation porte sur le respect précis de contraintes de sortie vérifiables, notamment lorsque celles-ci sont hors domaine et inédites par rapport à l’entraînement. IFBench sert ainsi à distinguer l’exécution littérale des consignes de la simple production d’une réponse globalement pertinente.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAllen Institute for AI (AI2) et University of Washington
Capacités mesuréesSuivi precis d'instructions et generalisation a des contraintes de sortie inedites (non vues a l'entrainement)
ModalitéTexte
Type de questionssuivi d'instructions avec contraintes de sortie verifiables hors domaine (prompts WildChat held-out)
Métrique d'évaluationtaux de respect des contraintes verifiables (accuracy)
AccèsPublic
Languesanglais
Taille du jeu58 contraintes verifiables out-of-domain (+ set d'entrainement IFTrain de 29 contraintes)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (27)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert81,7 %4 juin 2026Auto-déclaré
2Hermes 3 70BNous Research🟢 Ouvert81,2 %15 août 2024Auto-déclaré
3Nova 2 ProAmazon🔒 Propriétaire80,2 %2 décembre 2025Auto-déclaré
4Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire79,1 %19 mai 2026Auto-déclaré
5Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire79,1 %31 mai 2026Auto-déclaré
6Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert76,5 %24 février 2026Auto-déclaré
7Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert76,5 %16 février 2026Auto-déclaré
8Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert76,1 %24 février 2026Auto-déclaré
9MAI-Code-1-FlashMicrosoft🔒 Propriétaire75,0 %2 juin 2026Auto-déclaré
10Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire74,2 %31 mars 2026Auto-déclaré
11Command A+Cohere🟢 Ouvert74,0 %20 mai 2026Auto-déclaré
12Nemotron 3 Super (120B A12B)NVIDIA🟢 Ouvert72,6 %11 mars 2026Auto-déclaré
13Mercury 2Inception🔒 Propriétaire71,0 %24 février 2026Auto-déclaré
14Nova 2 LiteAmazon🔒 Propriétaire70,8 %2 décembre 2025Auto-déclaré
15Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert70,2 %24 février 2026Auto-déclaré
16MiniMax M2.1MiniMax🟢 Ouvert70,0 %23 décembre 2025Auto-déclaré
17GPT OSS 120BOpenAI🟢 Ouvert69,5 %5 août 2025Auto-déclaré
18MAI-Thinking-1Microsoft🔒 Propriétaire69,0 %2 juin 2026Auto-déclaré
19Mistral Medium 3.5Mistral AI🟢 Ouvert69,0 %29 avril 2026Auto-déclaré
20Nova 2 OmniAmazon🔒 Propriétaire68,7 %2 décembre 2025Auto-déclaré
21K-EXAONE-236B-A23BLG AI Research🔒 Propriétaire67,3 %31 décembre 2025Auto-déclaré
22Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert64,5 %2 mars 2026Auto-déclaré
23Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert59,2 %2 mars 2026Auto-déclaré
24Mistral Small 4Mistral AI🟢 Ouvert48,0 %16 mars 2026Auto-déclaré
25Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert41,3 %2 mars 2026Auto-déclaré
26Nova 2 SonicAmazon🔒 Propriétaire37,5 %2 décembre 2025Auto-déclaré
27Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert21,0 %2 mars 2026Auto-déclaré

Classement établi sur 27 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 70,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle respecte fréquemment les contraintes vérifiables imposées à ses sorties, y compris face à des formats non vus pendant l’entraînement. Cette mesure par accuracy apporte un critère explicite, moins dépendant d’un jugement qualitatif. La rigueur pratique doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs. Le caractère held-out des prompts et l’emploi de contraintes hors domaine visent la généralisation et limitent la dépendance aux contraintes d’IFTrain, sans élargir l’évaluation au-delà du suivi d’instructions en anglais. Avec 58 contraintes vérifiables, IFBench couvre une tâche ciblée plutôt qu’un éventail général de capacités. Le meilleur résultat observé, 82 % pour Nemotron 3 Ultra (550B A55B), reste inférieur à un respect systématique des contraintes, ce qui n’indique pas une saturation complète. La médiane de 71 % parmi 27 modèles montre néanmoins un niveau global déjà élevé, tandis que le classement fait apparaître une marge persistante entre performance courante et meilleure performance déclarée.


Sources des scores : llm-stats.