IFEval

IFEval est un benchmark publié en 2023 par Google Research, dans les travaux de Zhou et al. Il évalue la capacité des grands modèles de langage à suivre précisément des instructions explicites au sein de tâches de génération de texte ouverte.

IFEval est un benchmark publié en 2023 par Google Research, dans les travaux de Zhou et al. Il évalue la capacité des grands modèles de langage à suivre précisément des instructions explicites au sein de tâches de génération de texte ouverte.

Son approche repose sur des contraintes automatiquement vérifiables, portant notamment sur le format, la longueur, le style ou le contenu. IFEval permet ainsi d’isoler une aptitude essentielle des modèles conversationnels : produire une réponse qui respecte effectivement la consigne, plutôt que seulement fournir un texte pertinent ou plausible.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGoogle Research (Zhou et al.)
Capacités mesuréesgénéraliste, suivi d'instructions, sortie structurée
ModalitéTexte
Type de questionsgénération de texte ouverte avec contraintes vérifiables
Métrique d'évaluationaccuracy de respect des instructions, aux niveaux prompt et instruction, en versions strict et loose
AccèsPublic
Languesanglais
Taille du jeu541 prompts
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (65)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert95,0 %24 février 2026Auto-déclaré
2Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,6 %31 mai 2026Auto-déclaré
3Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire94,3 %31 mars 2026Auto-déclaré
4Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire94,3 %19 mai 2026Auto-déclaré
5o3-miniOpenAI🔒 Propriétaire93,9 %30 janvier 2025Auto-déclaré
6Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert93,4 %24 février 2026Auto-déclaré
7Claude 3.7 SonnetAnthropic🔒 Propriétaire93,2 %24 février 2025Auto-déclaré
8Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert92,6 %16 février 2026Auto-déclaré
9Llama 3.3 70B InstructMeta🟢 Ouvert92,1 %6 décembre 2024Auto-déclaré
10Nova ProAmazon🔒 Propriétaire92,1 %20 novembre 2024Auto-déclaré
11Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert91,9 %24 février 2026Auto-déclaré
12Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert91,5 %2 mars 2026Auto-déclaré
13Gemma 3 27BGoogle🟢 Ouvert90,4 %12 mars 2025Auto-déclaré
14Nemotron Nano 9B v2NVIDIA🟢 Ouvert90,3 %18 août 2025Auto-déclaré
15Gemma 3 4BGoogle🟢 Ouvert90,2 %12 mars 2025Auto-déclaré
16Kimi K2 InstructMoonshot AI🟢 Ouvert89,8 %11 juillet 2025Auto-déclaré
17Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert89,8 %5 septembre 2025Auto-déclaré
18Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert89,8 %2 mars 2026Auto-déclaré
19Nova LiteAmazon🔒 Propriétaire89,7 %20 novembre 2024Auto-déclaré
20LongCat-Flash-ChatMeituan🟢 Ouvert89,6 %29 août 2025Auto-déclaré
21Llama 3.1 Nemotron Ultra 253B v1NVIDIA🟢 Ouvert89,5 %7 avril 2025Auto-déclaré
22Gemma 3 12BGoogle🟢 Ouvert88,9 %12 mars 2025Auto-déclaré
23Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,9 %10 septembre 2025Auto-déclaré
24Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert88,7 %22 juillet 2025Auto-déclaré
25Llama 3.1 405B InstructMeta🟢 Ouvert88,6 %23 juillet 2024Auto-déclaré
26GPT-4.5OpenAI🔒 Propriétaire88,2 %5 mars 2026Auto-déclaré
27Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert88,2 %22 septembre 2025Auto-déclaré
28Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %22 septembre 2025Auto-déclaré
29Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert87,8 %22 septembre 2025Auto-déclaré
30Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert87,8 %25 juillet 2025Auto-déclaré
31Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert87,6 %10 septembre 2025Auto-déclaré
32Llama 3.1 70B InstructMeta🟢 Ouvert87,5 %23 juillet 2024Auto-déclaré
33GPT-4.1OpenAI🔒 Propriétaire87,4 %14 avril 2025Auto-déclaré
34Kimi-k1.5Moonshot AI🔒 Propriétaire87,2 %20 janvier 2025Auto-déclaré
35Nova MicroAmazon🔒 Propriétaire87,2 %20 novembre 2024Auto-déclaré
36DeepSeek-V3DeepSeek🟢 Ouvert86,1 %25 décembre 2024Auto-déclaré
37Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert85,8 %22 septembre 2025Auto-déclaré
38Phi 4 Reasoning PlusMicrosoft🟢 Ouvert84,9 %30 avril 2025Auto-déclaré
39Sarvam-105BSarvam AI🟢 Ouvert84,8 %6 mars 2026Auto-déclaré
40Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,7 %22 septembre 2025Auto-déclaré
41GPT-4.1 miniOpenAI🔒 Propriétaire84,1 %14 avril 2025Auto-déclaré
42Qwen2.5 72B InstructAlibaba Cloud / Qwen Team🟢 Ouvert84,1 %19 septembre 2024Auto-déclaré
43QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert83,9 %5 mars 2025Auto-déclaré
44Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert83,7 %22 septembre 2025Auto-déclaré
45Phi 4 ReasoningMicrosoft🟢 Ouvert83,4 %30 avril 2025Auto-déclaré
46Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert83,2 %22 septembre 2025Auto-déclaré
47Mistral Small 3 24B InstructMistral AI🟢 Ouvert82,9 %30 janvier 2025Auto-déclaré
48Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert82,6 %22 septembre 2025Auto-déclaré
49Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert82,3 %22 septembre 2025Auto-déclaré
50Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert81,7 %22 septembre 2025Auto-déclaré
51GPT-4oOpenAI🔒 Propriétaire81,0 %27 mars 2025Auto-déclaré
52Llama 3.1 8B InstructMeta🟢 Ouvert80,4 %23 juillet 2024Auto-déclaré
53Gemma 3 1BGoogle🟢 Ouvert80,2 %12 mars 2025Auto-déclaré
54Llama 3.1 Nemotron Nano 8B V1NVIDIA🟢 Ouvert79,3 %18 mars 2025Auto-déclaré
55Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert78,6 %2 mars 2026Auto-déclaré
56Llama 3.2 3B InstructMeta🟢 Ouvert77,4 %25 septembre 2024Auto-déclaré
57MiniCPM-SALAOpenBMB🟢 Ouvert76,3 %11 février 2026Auto-déclaré
58Granite 3.3 8B BaseIBM🟢 Ouvert74,8 %16 avril 2025Auto-déclaré
59Granite 3.3 8B InstructIBM🟢 Ouvert74,8 %16 avril 2025Auto-déclaré
60GPT-4.1 nanoOpenAI🔒 Propriétaire74,5 %14 avril 2025Auto-déclaré
61Qwen2.5 7B InstructAlibaba Cloud / Qwen Team🟢 Ouvert71,2 %19 septembre 2024Auto-déclaré
62IBM Granite 4.0 Tiny PreviewIBM🟢 Ouvert63,0 %2 mai 2025Auto-déclaré
63Phi 4Microsoft🟢 Ouvert63,0 %12 décembre 2024Auto-déclaré
64Pixtral-12BMistral AI🟢 Ouvert61,3 %17 septembre 2024Auto-déclaré
65Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert44,0 %2 mars 2026Auto-déclaré

Classement établi sur 65 modèles évalués, dont 28 de grands éditeurs. Score médian de l'ensemble : 87,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur IFEval indique qu’un modèle respecte fréquemment les contraintes explicites imposées, y compris lorsqu’un prompt en combine plusieurs. L’évaluation distingue le respect au niveau du prompt et de chaque instruction, avec des versions strict et loose. Cette méthode apporte une mesure structurée et automatiquement vérifiable, mais la fiabilité des résultats présentés doit être nuancée : ils sont majoritairement auto-déclarés par les éditeurs.

Le niveau médian de 87 % parmi les 65 modèles de la base, face à un meilleur score de 95 % pour Qwen3.5-27B, suggère une forte concentration vers le haut de l’échelle et donc un risque de saturation. Les écarts restants peuvent néanmoins refléter une meilleure régularité dans le suivi des consignes. L’accès public appelle aussi à considérer un risque de contamination lors de l’interprétation des performances. Enfin, la portée demeure ciblée : IFEval couvre des instructions vérifiables en anglais. Il mesure donc précisément le respect de contraintes formelles et textuelles, sans constituer une évaluation générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.