IF
LiveBench: IF est la catégorie consacrée au suivi d’instructions au sein de LiveBench, un benchmark créé par les auteurs de LiveBench, Colin White et al., avec Abacus.AI, NYU et NVIDIA. Publié en 2024, il repose sur une version durcie et sans contamination d’IFEval.
LiveBench: IF est la catégorie consacrée au suivi d’instructions au sein de LiveBench, un benchmark créé par les auteurs de LiveBench, Colin White et al., avec Abacus.AI, NYU et NVIDIA. Publié en 2024, il repose sur une version durcie et sans contamination d’IFEval.
Les modèles sont confrontés à des tâches en anglais de paraphrase, de simplification, de résumé et de génération d’histoire. Une notation automatique sur vérité-terrain mesure leur capacité à respecter les consignes, tandis que l’actualisation régulière des questions contribue au rôle contamination-free de LiveBench.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Abacus.AI, NYU, NVIDIA (auteurs LiveBench, Colin White et al.) |
| Capacités mesurées | suivi d'instructions |
| Modalité | Texte |
| Type de questions | tâches de suivi d'instructions (versions durcies et sans contamination d'IFEval: paraphrase, simplification, résumé, génération d'histoire) |
| Métrique d'évaluation | score automatique objectif sur vérité-terrain (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | catégorie 'instruction following' de LiveBench (sous-ensemble; questions actualisées régulièrement) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.1 Pro Preview | ▫ n.d. | 79,1 % | 19 février 2026 | ✅ Mesuré | |
| 2 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 65,2 % | 20 mai 2026 | ✅ Mesuré |
| 3 | Kimi K2.6 Thinking | Moonshot AI | ▫ n.d. | 64,4 % | — | ✅ Mesuré |
| 4 | DeepSeek V4 Flash | DeepSeek | ▫ n.d. | 63,1 % | 24 avril 2026 | ✅ Mesuré |
| 5 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 62,5 % | 24 novembre 2025 | ✅ Mesuré |
| 6 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 62,4 % | 24 avril 2026 | ✅ Mesuré |
| 7 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 61,8 % | 11 décembre 2025 | ✅ Mesuré |
Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 63,1 %.
Notre analyse
Un score élevé indique qu’un modèle respecte correctement les contraintes attendues sur plusieurs formes de suivi d’instructions, selon une mesure objective d’accuracy. Cette rigueur tient à la correction automatique sur vérité-terrain, à la version durcie d’IFEval et à l’actualisation régulière des questions. Il faut toutefois distinguer la méthode de notation de la provenance des résultats publiés dans la base, ceux-ci étant majoritairement auto-déclarés par les éditeurs.
Le classement montre une dispersion encore nette entre les 26 modèles évalués. Gemini 3.1 Pro Preview arrive en tête à 79 %, tandis que la médiane atteint 64 %. Cet écart suggère que la catégorie n’est pas saturée et qu’elle conserve un pouvoir discriminant entre modèles. La conception sans contamination vise à limiter l’exposition préalable aux questions, mais l’interprétation reste circonscrite au sous-ensemble « instruction following » de LiveBench. Elle porte sur quatre familles de tâches en anglais et ne résume donc pas les performances générales d’un modèle dans les cinq autres catégories du benchmark.
Sources des scores : livebench.