IF

LiveBench: IF est la catégorie consacrée au suivi d’instructions au sein de LiveBench, un benchmark créé par les auteurs de LiveBench, Colin White et al., avec Abacus.AI, NYU et NVIDIA. Publié en 2024, il repose sur une version durcie et sans contamination d’IFEval.

LiveBench: IF est la catégorie consacrée au suivi d’instructions au sein de LiveBench, un benchmark créé par les auteurs de LiveBench, Colin White et al., avec Abacus.AI, NYU et NVIDIA. Publié en 2024, il repose sur une version durcie et sans contamination d’IFEval.

Les modèles sont confrontés à des tâches en anglais de paraphrase, de simplification, de résumé et de génération d’histoire. Une notation automatique sur vérité-terrain mesure leur capacité à respecter les consignes, tandis que l’actualisation régulière des questions contribue au rôle contamination-free de LiveBench.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkAbacus.AI, NYU, NVIDIA (auteurs LiveBench, Colin White et al.)
Capacités mesuréessuivi d'instructions
ModalitéTexte
Type de questionstâches de suivi d'instructions (versions durcies et sans contamination d'IFEval: paraphrase, simplification, résumé, génération d'histoire)
Métrique d'évaluationscore automatique objectif sur vérité-terrain (accuracy)
AccèsPublic
Languesanglais
Taille du jeucatégorie 'instruction following' de LiveBench (sous-ensemble; questions actualisées régulièrement)
Année de publication2024
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.1 Pro PreviewGoogle▫ n.d.79,1 %19 février 2026✅ Mesuré
2xAI: Grok Build 0.1xAI▫ n.d.65,2 %20 mai 2026✅ Mesuré
3Kimi K2.6 ThinkingMoonshot AI▫ n.d.64,4 %✅ Mesuré
4DeepSeek V4 FlashDeepSeek▫ n.d.63,1 %24 avril 2026✅ Mesuré
5Claude Opus 4.5Anthropic🔒 Propriétaire62,5 %24 novembre 2025✅ Mesuré
6DeepSeek V4 ProDeepSeek▫ n.d.62,4 %24 avril 2026✅ Mesuré
7GPT-5.2OpenAI🔒 Propriétaire61,8 %11 décembre 2025✅ Mesuré

Classement établi sur 7 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 63,1 %.

Notre analyse

Un score élevé indique qu’un modèle respecte correctement les contraintes attendues sur plusieurs formes de suivi d’instructions, selon une mesure objective d’accuracy. Cette rigueur tient à la correction automatique sur vérité-terrain, à la version durcie d’IFEval et à l’actualisation régulière des questions. Il faut toutefois distinguer la méthode de notation de la provenance des résultats publiés dans la base, ceux-ci étant majoritairement auto-déclarés par les éditeurs.

Le classement montre une dispersion encore nette entre les 26 modèles évalués. Gemini 3.1 Pro Preview arrive en tête à 79 %, tandis que la médiane atteint 64 %. Cet écart suggère que la catégorie n’est pas saturée et qu’elle conserve un pouvoir discriminant entre modèles. La conception sans contamination vise à limiter l’exposition préalable aux questions, mais l’interprétation reste circonscrite au sous-ensemble « instruction following » de LiveBench. Elle porte sur quatre familles de tâches en anglais et ne résume donc pas les performances générales d’un modèle dans les cinq autres catégories du benchmark.


Sources des scores : livebench.