IFBench
IFBench est un benchmark conçu par l’Allen Institute for AI (AI2) et l’University of Washington pour évaluer la capacité des modèles à suivre des instructions complexes. Il s’appuie sur des prompts en anglais issus d’un ensemble WildChat tenu à l’écart.
IFBench est un benchmark conçu par l’Allen Institute for AI (AI2) et l’University of Washington pour évaluer la capacité des modèles à suivre des instructions complexes. Il s’appuie sur des prompts en anglais issus d’un ensemble WildChat tenu à l’écart.
L’évaluation porte sur le respect précis de contraintes de sortie vérifiables, notamment lorsque celles-ci sont hors domaine et inédites par rapport à l’entraînement. IFBench sert ainsi à distinguer l’exécution littérale des consignes de la simple production d’une réponse globalement pertinente.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Allen Institute for AI (AI2) et University of Washington |
| Capacités mesurées | Suivi precis d'instructions et generalisation a des contraintes de sortie inedites (non vues a l'entrainement) |
| Modalité | Texte |
| Type de questions | suivi d'instructions avec contraintes de sortie verifiables hors domaine (prompts WildChat held-out) |
| Métrique d'évaluation | taux de respect des contraintes verifiables (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 58 contraintes verifiables out-of-domain (+ set d'entrainement IFTrain de 29 contraintes) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (27)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 81,7 % | 4 juin 2026 | Auto-déclaré |
| 2 | Hermes 3 70B | Nous Research | 🟢 Ouvert | 81,2 % | 15 août 2024 | Auto-déclaré |
| 3 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 80,2 % | 2 décembre 2025 | Auto-déclaré |
| 4 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 79,1 % | 19 mai 2026 | Auto-déclaré |
| 5 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 79,1 % | 31 mai 2026 | Auto-déclaré |
| 6 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,5 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,5 % | 16 février 2026 | Auto-déclaré |
| 8 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 76,1 % | 24 février 2026 | Auto-déclaré |
| 9 | MAI-Code-1-Flash | Microsoft | 🔒 Propriétaire | 75,0 % | 2 juin 2026 | Auto-déclaré |
| 10 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 74,2 % | 31 mars 2026 | Auto-déclaré |
| 11 | Command A+ | Cohere | 🟢 Ouvert | 74,0 % | 20 mai 2026 | Auto-déclaré |
| 12 | Nemotron 3 Super (120B A12B) | NVIDIA | 🟢 Ouvert | 72,6 % | 11 mars 2026 | Auto-déclaré |
| 13 | Mercury 2 | Inception | 🔒 Propriétaire | 71,0 % | 24 février 2026 | Auto-déclaré |
| 14 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 70,8 % | 2 décembre 2025 | Auto-déclaré |
| 15 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,2 % | 24 février 2026 | Auto-déclaré |
| 16 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 70,0 % | 23 décembre 2025 | Auto-déclaré |
| 17 | GPT OSS 120B | OpenAI | 🟢 Ouvert | 69,5 % | 5 août 2025 | Auto-déclaré |
| 18 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 69,0 % | 2 juin 2026 | Auto-déclaré |
| 19 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 69,0 % | 29 avril 2026 | Auto-déclaré |
| 20 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 68,7 % | 2 décembre 2025 | Auto-déclaré |
| 21 | K-EXAONE-236B-A23B | LG AI Research | 🔒 Propriétaire | 67,3 % | 31 décembre 2025 | Auto-déclaré |
| 22 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,5 % | 2 mars 2026 | Auto-déclaré |
| 23 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,2 % | 2 mars 2026 | Auto-déclaré |
| 24 | Mistral Small 4 | Mistral AI | 🟢 Ouvert | 48,0 % | 16 mars 2026 | Auto-déclaré |
| 25 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 41,3 % | 2 mars 2026 | Auto-déclaré |
| 26 | Nova 2 Sonic | Amazon | 🔒 Propriétaire | 37,5 % | 2 décembre 2025 | Auto-déclaré |
| 27 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 21,0 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 27 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 70,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle respecte fréquemment les contraintes vérifiables imposées à ses sorties, y compris face à des formats non vus pendant l’entraînement. Cette mesure par accuracy apporte un critère explicite, moins dépendant d’un jugement qualitatif. La rigueur pratique doit toutefois être nuancée, car les scores de la base sont majoritairement auto-déclarés par les éditeurs. Le caractère held-out des prompts et l’emploi de contraintes hors domaine visent la généralisation et limitent la dépendance aux contraintes d’IFTrain, sans élargir l’évaluation au-delà du suivi d’instructions en anglais. Avec 58 contraintes vérifiables, IFBench couvre une tâche ciblée plutôt qu’un éventail général de capacités. Le meilleur résultat observé, 82 % pour Nemotron 3 Ultra (550B A55B), reste inférieur à un respect systématique des contraintes, ce qui n’indique pas une saturation complète. La médiane de 71 % parmi 27 modèles montre néanmoins un niveau global déjà élevé, tandis que le classement fait apparaître une marge persistante entre performance courante et meilleure performance déclarée.
Sources des scores : llm-stats.