IFEval
IFEval est un benchmark publié en 2023 par Google Research, dans les travaux de Zhou et al. Il évalue la capacité des grands modèles de langage à suivre précisément des instructions explicites au sein de tâches de génération de texte ouverte.
IFEval est un benchmark publié en 2023 par Google Research, dans les travaux de Zhou et al. Il évalue la capacité des grands modèles de langage à suivre précisément des instructions explicites au sein de tâches de génération de texte ouverte.
Son approche repose sur des contraintes automatiquement vérifiables, portant notamment sur le format, la longueur, le style ou le contenu. IFEval permet ainsi d’isoler une aptitude essentielle des modèles conversationnels : produire une réponse qui respecte effectivement la consigne, plutôt que seulement fournir un texte pertinent ou plausible.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Google Research (Zhou et al.) |
| Capacités mesurées | généraliste, suivi d'instructions, sortie structurée |
| Modalité | Texte |
| Type de questions | génération de texte ouverte avec contraintes vérifiables |
| Métrique d'évaluation | accuracy de respect des instructions, aux niveaux prompt et instruction, en versions strict et loose |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 541 prompts |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (65)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 95,0 % | 24 février 2026 | Auto-déclaré |
| 2 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,6 % | 31 mai 2026 | Auto-déclaré |
| 3 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,3 % | 31 mars 2026 | Auto-déclaré |
| 4 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 94,3 % | 19 mai 2026 | Auto-déclaré |
| 5 | o3-mini | OpenAI | 🔒 Propriétaire | 93,9 % | 30 janvier 2025 | Auto-déclaré |
| 6 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 93,4 % | 24 février 2026 | Auto-déclaré |
| 7 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 93,2 % | 24 février 2025 | Auto-déclaré |
| 8 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 92,6 % | 16 février 2026 | Auto-déclaré |
| 9 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 92,1 % | 6 décembre 2024 | Auto-déclaré |
| 10 | Nova Pro | Amazon | 🔒 Propriétaire | 92,1 % | 20 novembre 2024 | Auto-déclaré |
| 11 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,9 % | 24 février 2026 | Auto-déclaré |
| 12 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 91,5 % | 2 mars 2026 | Auto-déclaré |
| 13 | Gemma 3 27B | 🟢 Ouvert | 90,4 % | 12 mars 2025 | Auto-déclaré | |
| 14 | Nemotron Nano 9B v2 | NVIDIA | 🟢 Ouvert | 90,3 % | 18 août 2025 | Auto-déclaré |
| 15 | Gemma 3 4B | 🟢 Ouvert | 90,2 % | 12 mars 2025 | Auto-déclaré | |
| 16 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 89,8 % | 11 juillet 2025 | Auto-déclaré |
| 17 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 89,8 % | 5 septembre 2025 | Auto-déclaré |
| 18 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 89,8 % | 2 mars 2026 | Auto-déclaré |
| 19 | Nova Lite | Amazon | 🔒 Propriétaire | 89,7 % | 20 novembre 2024 | Auto-déclaré |
| 20 | LongCat-Flash-Chat | Meituan | 🟢 Ouvert | 89,6 % | 29 août 2025 | Auto-déclaré |
| 21 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 🟢 Ouvert | 89,5 % | 7 avril 2025 | Auto-déclaré |
| 22 | Gemma 3 12B | 🟢 Ouvert | 88,9 % | 12 mars 2025 | Auto-déclaré | |
| 23 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,9 % | 10 septembre 2025 | Auto-déclaré |
| 24 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,7 % | 22 juillet 2025 | Auto-déclaré |
| 25 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 88,6 % | 23 juillet 2024 | Auto-déclaré |
| 26 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 88,2 % | 5 mars 2026 | Auto-déclaré |
| 27 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 88,2 % | 22 septembre 2025 | Auto-déclaré |
| 28 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 22 septembre 2025 | Auto-déclaré |
| 29 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 22 septembre 2025 | Auto-déclaré |
| 30 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,8 % | 25 juillet 2025 | Auto-déclaré |
| 31 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 87,6 % | 10 septembre 2025 | Auto-déclaré |
| 32 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 87,5 % | 23 juillet 2024 | Auto-déclaré |
| 33 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 87,4 % | 14 avril 2025 | Auto-déclaré |
| 34 | Kimi-k1.5 | Moonshot AI | 🔒 Propriétaire | 87,2 % | 20 janvier 2025 | Auto-déclaré |
| 35 | Nova Micro | Amazon | 🔒 Propriétaire | 87,2 % | 20 novembre 2024 | Auto-déclaré |
| 36 | DeepSeek-V3 | DeepSeek | 🟢 Ouvert | 86,1 % | 25 décembre 2024 | Auto-déclaré |
| 37 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 85,8 % | 22 septembre 2025 | Auto-déclaré |
| 38 | Phi 4 Reasoning Plus | Microsoft | 🟢 Ouvert | 84,9 % | 30 avril 2025 | Auto-déclaré |
| 39 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 84,8 % | 6 mars 2026 | Auto-déclaré |
| 40 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,7 % | 22 septembre 2025 | Auto-déclaré |
| 41 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 84,1 % | 14 avril 2025 | Auto-déclaré |
| 42 | Qwen2.5 72B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 84,1 % | 19 septembre 2024 | Auto-déclaré |
| 43 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,9 % | 5 mars 2025 | Auto-déclaré |
| 44 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,7 % | 22 septembre 2025 | Auto-déclaré |
| 45 | Phi 4 Reasoning | Microsoft | 🟢 Ouvert | 83,4 % | 30 avril 2025 | Auto-déclaré |
| 46 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 83,2 % | 22 septembre 2025 | Auto-déclaré |
| 47 | Mistral Small 3 24B Instruct | Mistral AI | 🟢 Ouvert | 82,9 % | 30 janvier 2025 | Auto-déclaré |
| 48 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,6 % | 22 septembre 2025 | Auto-déclaré |
| 49 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 82,3 % | 22 septembre 2025 | Auto-déclaré |
| 50 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 81,7 % | 22 septembre 2025 | Auto-déclaré |
| 51 | GPT-4o | OpenAI | 🔒 Propriétaire | 81,0 % | 27 mars 2025 | Auto-déclaré |
| 52 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 80,4 % | 23 juillet 2024 | Auto-déclaré |
| 53 | Gemma 3 1B | 🟢 Ouvert | 80,2 % | 12 mars 2025 | Auto-déclaré | |
| 54 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 79,3 % | 18 mars 2025 | Auto-déclaré |
| 55 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 78,6 % | 2 mars 2026 | Auto-déclaré |
| 56 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 77,4 % | 25 septembre 2024 | Auto-déclaré |
| 57 | MiniCPM-SALA | OpenBMB | 🟢 Ouvert | 76,3 % | 11 février 2026 | Auto-déclaré |
| 58 | Granite 3.3 8B Base | IBM | 🟢 Ouvert | 74,8 % | 16 avril 2025 | Auto-déclaré |
| 59 | Granite 3.3 8B Instruct | IBM | 🟢 Ouvert | 74,8 % | 16 avril 2025 | Auto-déclaré |
| 60 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 74,5 % | 14 avril 2025 | Auto-déclaré |
| 61 | Qwen2.5 7B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,2 % | 19 septembre 2024 | Auto-déclaré |
| 62 | IBM Granite 4.0 Tiny Preview | IBM | 🟢 Ouvert | 63,0 % | 2 mai 2025 | Auto-déclaré |
| 63 | Phi 4 | Microsoft | 🟢 Ouvert | 63,0 % | 12 décembre 2024 | Auto-déclaré |
| 64 | Pixtral-12B | Mistral AI | 🟢 Ouvert | 61,3 % | 17 septembre 2024 | Auto-déclaré |
| 65 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,0 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 65 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 87,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur IFEval indique qu’un modèle respecte fréquemment les contraintes explicites imposées, y compris lorsqu’un prompt en combine plusieurs. L’évaluation distingue le respect au niveau du prompt et de chaque instruction, avec des versions strict et loose. Cette méthode apporte une mesure structurée et automatiquement vérifiable, mais la fiabilité des résultats présentés doit être nuancée : ils sont majoritairement auto-déclarés par les éditeurs.
Le niveau médian de 87 % parmi les 65 modèles de la base, face à un meilleur score de 95 % pour Qwen3.5-27B, suggère une forte concentration vers le haut de l’échelle et donc un risque de saturation. Les écarts restants peuvent néanmoins refléter une meilleure régularité dans le suivi des consignes. L’accès public appelle aussi à considérer un risque de contamination lors de l’interprétation des performances. Enfin, la portée demeure ciblée : IFEval couvre des instructions vérifiables en anglais. Il mesure donc précisément le respect de contraintes formelles et textuelles, sans constituer une évaluation générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.