Instruction Following (Baseline)

Benchable : Instruction Following (Baseline) est un benchmark public créé par Benchable pour évaluer la capacité des modèles d’IA à suivre précisément des consignes en anglais. Les tâches progressent de directives simples vers des instructions conditionnelles à plusieurs niveaux, pouvant…

Benchable : Instruction Following (Baseline) est un benchmark public créé par Benchable pour évaluer la capacité des modèles d’IA à suivre précisément des consignes en anglais. Les tâches progressent de directives simples vers des instructions conditionnelles à plusieurs niveaux, pouvant cumuler de nombreuses exigences.

Le test examine notamment le respect du formatage, de l’ordre du contenu, des calculs et de la logique conditionnelle. Sa notation par correspondance exacte de l’ensemble du texte en fait un indicateur strict de conformité, utile pour distinguer les modèles capables d’exécuter fidèlement des instructions complexes.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesSuivi precis d'instructions (formatage, ordre du contenu, calculs, logique conditionnelle) sur une gradation de complexite
ModalitéTexte
Type de questionsTaches de suivi d'instructions a complexite croissante
Métrique d'évaluationConformite exacte aux instructions (Exact Match, tout le texte)
AccèsPublic
Languesanglais
Taille du jeu100 etapes
RessourcesSite / dépôt officiel

Classement des modèles (164)

#ModèleÉditeurLicenceScoreSortieFiabilité
1StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
2inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.100,0 %23 avril 2026✅ Mesuré
3inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.100,0 %8 mai 2026✅ Mesuré
4Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.94,9 %25 février 2026✅ Mesuré
5Gemini 3.1 Pro PreviewGoogle▫ n.d.93,9 %19 février 2026✅ Mesuré
6OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire92,0 %9 juillet 2026✅ Mesuré
7Perceptron: Perceptron Mk1Perceptron▫ n.d.91,4 %12 mai 2026✅ Mesuré
8GPT-5OpenAI🔒 Propriétaire91,0 %7 août 2025✅ Mesuré
9GPT-5.6 SolOpenAI🔒 Propriétaire91,0 %9 juillet 2026✅ Mesuré
10OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire91,0 %10 décembre 2025✅ Mesuré
11OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire88,0 %5 mai 2026✅ Mesuré
12Sakana: Fugu UltraSakana AI▫ n.d.88,0 %24 juin 2026✅ Mesuré
13OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire86,9 %9 juillet 2026✅ Mesuré
14Muse Spark 1.1Meta🔒 Propriétaire86,2 %9 juillet 2026✅ Mesuré
15GPT-5.2OpenAI🔒 Propriétaire86,0 %11 décembre 2025✅ Mesuré
16gemini-3-pro-imageGoogle▫ n.d.86,0 %✅ Mesuré
17OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire85,0 %4 décembre 2025✅ Mesuré
18Qwen: Qwen3.6 Max PreviewAlibaba Cloud / Qwen Team▫ n.d.84,8 %27 avril 2026✅ Mesuré
19DeepSeek V4 FlashDeepSeek▫ n.d.84,0 %24 avril 2026✅ Mesuré
20Z.ai: GLM 5 TurboZhipu AI▫ n.d.84,0 %15 mars 2026✅ Mesuré
21gemini-2.5-pro-preview-03-25Google▫ n.d.84,0 %✅ Mesuré
22kimi-k2.5-0127Moonshot AI▫ n.d.84,0 %✅ Mesuré
23GPT-5.1OpenAI🔒 Propriétaire83,0 %13 novembre 2025✅ Mesuré
24OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire83,0 %9 juillet 2026✅ Mesuré
25OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire83,0 %13 novembre 2025✅ Mesuré
26OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire82,0 %21 avril 2026✅ Mesuré
27Seed 1.6ByteDance Seed▫ n.d.82,0 %23 décembre 2025✅ Mesuré
28qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.82,0 %2 avril 2026✅ Mesuré
29GPT-5.6 LunaOpenAI🔒 Propriétaire81,0 %9 juillet 2026✅ Mesuré
30GPT-5.6 TerraOpenAI🔒 Propriétaire81,0 %9 juillet 2026✅ Mesuré
31cydonia-24b-v4.1thedrummer▫ n.d.80,4 %✅ Mesuré
32DeepSeek V4 ProDeepSeek▫ n.d.80,0 %24 avril 2026✅ Mesuré
33Tencent: Hy3 previewTencent🟢 Ouvert79,0 %22 avril 2026✅ Mesuré
34gemini-3.1-flash-imageGoogle▫ n.d.78,0 %✅ Mesuré
35Claude Opus 4.5Anthropic🔒 Propriétaire77,0 %24 novembre 2025✅ Mesuré
36Kimi K2Moonshot AI▫ n.d.77,0 %6 novembre 2025✅ Mesuré
37gemini-3.1-flash-image-previewGoogle▫ n.d.77,0 %✅ Mesuré
38o1OpenAI🔒 Propriétaire77,0 %17 décembre 2024✅ Mesuré
39GPT-4.1 miniOpenAI🔒 Propriétaire76,4 %14 avril 2025✅ Mesuré
40GPT-4.1OpenAI🔒 Propriétaire76,0 %14 avril 2025✅ Mesuré
41Qwen 3.5 PlusQwen▫ n.d.76,0 %16 février 2026✅ Mesuré
42AionLabs: Aion-3.0-MiniAion Labs▫ n.d.75,8 %7 juillet 2026✅ Mesuré
43GPT-5 miniOpenAI🔒 Propriétaire75,0 %7 août 2025✅ Mesuré
44Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert75,0 %8 juin 2026✅ Mesuré
45Thinking Machines: InklingThinking Machines🟢 Ouvert75,0 %17 juillet 2026✅ Mesuré
46gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire75,0 %7 août 2025✅ Mesuré
47Hy3Tencent🟢 Ouvert74,0 %6 juillet 2026✅ Mesuré
48Claude Opus 4Anthropic🔒 Propriétaire71,0 %22 mai 2025✅ Mesuré
49Qwen: Qwen3 Coder PlusAlibaba Cloud / Qwen Team▫ n.d.71,0 %23 septembre 2025✅ Mesuré
50deepseek-chat-v3DeepSeek▫ n.d.71,0 %✅ Mesuré
51deepseek-chat-v3-0324DeepSeek▫ n.d.71,0 %✅ Mesuré
52mistral-large-2512mistralai▫ n.d.71,0 %✅ Mesuré
53ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.70,0 %23 décembre 2025✅ Mesuré
54Claude Haiku 4.5Anthropic🔒 Propriétaire70,0 %15 octobre 2025✅ Mesuré
55Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.70,0 %13 novembre 2025✅ Mesuré
56Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.70,0 %27 avril 2026✅ Mesuré
57deepseek-chat-v3.1DeepSeek▫ n.d.70,0 %✅ Mesuré
58Claude Opus 4.1Anthropic🔒 Propriétaire69,0 %5 août 2025✅ Mesuré
59GPT-4oOpenAI🔒 Propriétaire69,0 %27 mars 2025✅ Mesuré
60GPT-5 nanoOpenAI🔒 Propriétaire69,0 %7 août 2025✅ Mesuré
61OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire69,0 %25 janvier 2024✅ Mesuré
62OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert69,0 %29 octobre 2025✅ Mesuré
63laguna-xs-2.1poolside▫ n.d.68,0 %✅ Mesuré
64AionLabs: Aion-3.0Aion Labs▫ n.d.67,7 %7 juillet 2026✅ Mesuré
65Claude Sonnet 4.5Anthropic🔒 Propriétaire67,7 %29 septembre 2025✅ Mesuré
66GPT-4OpenAI🔒 Propriétaire67,0 %28 août 2023✅ Mesuré
67Claude Sonnet 4Anthropic🔒 Propriétaire66,0 %22 mai 2025✅ Mesuré
68Mistral: Mistral Medium 3.1Mistral AI▫ n.d.66,0 %13 août 2025✅ Mesuré
69qwen3-coder-480b-a35b-07-25Alibaba Cloud / Qwen Team▫ n.d.65,4 %✅ Mesuré
70Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.65,0 %27 mars 2026✅ Mesuré
71MiniMax: MiniMax-01MiniMax🟢 Ouvert65,0 %15 janvier 2025✅ Mesuré
72Mistral: Mistral Medium 3Mistral AI▫ n.d.64,0 %7 mai 2025✅ Mesuré
73Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert64,0 %24 juin 2026✅ Mesuré
74Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.63,6 %25 février 2026✅ Mesuré
75Arcee AI: Virtuoso LargeArcee AI▫ n.d.63,0 %5 mai 2025✅ Mesuré
76Mistral LargeMistral AI▫ n.d.63,0 %26 février 2024✅ Mesuré
77hermes-3-llama-3.1-405bnousresearch▫ n.d.63,0 %✅ Mesuré
78mistral-saba-2502mistralai▫ n.d.63,0 %✅ Mesuré
79qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.63,0 %✅ Mesuré
80MiniMax M1MiniMax🟢 Ouvert62,6 %17 juin 2025✅ Mesuré
81Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert62,0 %30 juin 2025✅ Mesuré
82Mistral Large 2407Mistral AI▫ n.d.62,0 %19 novembre 2024✅ Mesuré
83devstral-2512mistralai▫ n.d.62,0 %✅ Mesuré
84Claude 3 HaikuAnthropic🔒 Propriétaire61,0 %13 mars 2024✅ Mesuré
85Nous: Hermes 4 405BNous Research🟢 Ouvert61,0 %26 août 2025✅ Mesuré
86qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.61,0 %8 septembre 2025✅ Mesuré
87qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.60,8 %✅ Mesuré
88GPT-4o miniOpenAI🔒 Propriétaire60,5 %18 juillet 2024✅ Mesuré
89Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire60,0 %30 octobre 2025✅ Mesuré
90qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.60,0 %✅ Mesuré
91xAI: Grok Build 0.1xAI▫ n.d.60,0 %20 mai 2026✅ Mesuré
92Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert59,8 %29 juillet 2025✅ Mesuré
93qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert59,6 %4 février 2026✅ Mesuré
94uncensoredvenice▫ n.d.59,1 %✅ Mesuré
95l3.3-euryale-70b-v2.3sao10k▫ n.d.59,0 %✅ Mesuré
96Mistral: Codestral 2508Mistral AI▫ n.d.57,0 %1 août 2025✅ Mesuré
97Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.56,0 %17 septembre 2025✅ Mesuré
98qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.55,7 %✅ Mesuré
99hermes-3-llama-3.1-70bnousresearch▫ n.d.55,6 %✅ Mesuré
100GPT-4.1 nanoOpenAI🔒 Propriétaire55,5 %14 avril 2025✅ Mesuré
101Nous: Hermes 4 70BNous Research🟢 Ouvert55,1 %26 août 2025✅ Mesuré
102AionLabs: Aion-2.0Aion Labs▫ n.d.55,0 %23 février 2026✅ Mesuré
103nova-pro-v1Amazon🔒 Propriétaire55,0 %✅ Mesuré
104Relace: Relace Searchrelace▫ n.d.53,0 %8 décembre 2025✅ Mesuré
105ministral-14b-2512mistralai▫ n.d.52,0 %✅ Mesuré
106mistral-small-24b-instruct-2501mistralai▫ n.d.52,0 %✅ Mesuré
107mistral-small-2603mistralai▫ n.d.52,0 %✅ Mesuré
108Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert51,5 %31 juillet 2025✅ Mesuré
109Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert51,0 %30 octobre 2025✅ Mesuré
110qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.50,5 %✅ Mesuré
111Cohere: Command R (08-2024)Cohere🟢 Ouvert50,0 %30 août 2024✅ Mesuré
112Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert50,0 %17 avril 2024✅ Mesuré
113Upstage: Solar Pro 3Upstage▫ n.d.50,0 %27 janvier 2026✅ Mesuré
114ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.49,0 %26 février 2026✅ Mesuré
115gpt-3.5-turbo-0613OpenAI🔒 Propriétaire49,0 %✅ Mesuré
116command-r-plus-08-2024Cohere▫ n.d.48,0 %✅ Mesuré
117nova-2-lite-v1Amazon🔒 Propriétaire48,0 %2 décembre 2025✅ Mesuré
118l3.1-euryale-70bsao10k▫ n.d.47,5 %✅ Mesuré
119Writer: Palmyra X5Writer▫ n.d.47,1 %21 janvier 2026✅ Mesuré
120Sonar ProPerplexity🔒 Propriétaire47,0 %7 mars 2025✅ Mesuré
121granite-4.0-h-microIBM🟢 Ouvert46,2 %20 octobre 2025✅ Mesuré
122AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert44,0 %8 août 2025✅ Mesuré
123ministral-8b-2512mistralai▫ n.d.44,0 %✅ Mesuré
124skyfall-36b-v2thedrummer▫ n.d.42,0 %✅ Mesuré
125l3-lunaris-8bsao10k▫ n.d.41,0 %✅ Mesuré
126qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.40,4 %✅ Mesuré
127qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.39,7 %✅ Mesuré
128unslopnemo-12bthedrummer▫ n.d.39,0 %✅ Mesuré
129llama-4-scout-17b-16e-instructMeta▫ n.d.38,7 %✅ Mesuré
130OpenAI: GPT-3.5 Turbo InstructOpenAI🔒 Propriétaire38,0 %28 septembre 2023✅ Mesuré
131Mistral NeMoMistral AI▫ n.d.37,0 %18 juillet 2024✅ Mesuré
132rocinante-12bthedrummer▫ n.d.36,0 %✅ Mesuré
133ministral-3b-2512mistralai▫ n.d.33,0 %✅ Mesuré
134ui-tars-1.5-7bByteDance▫ n.d.32,3 %✅ Mesuré
135SonarPerplexity🔒 Propriétaire32,0 %29 janvier 2025✅ Mesuré
136llama-4-maverick-17b-128e-instructMeta▫ n.d.30,3 %✅ Mesuré
137Cohere: Command R7B (12-2024)Cohere▫ n.d.27,0 %14 décembre 2024✅ Mesuré
138MiniMax: MiniMax M2-herMiniMax▫ n.d.27,0 %23 janvier 2026✅ Mesuré
139Meta: Llama 3.2 1B InstructMeta🟢 Ouvert18,9 %25 septembre 2024✅ Mesuré
140IBM: Granite 4.1 8BIBM🟢 Ouvert16,0 %30 avril 2026✅ Mesuré
141qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.14,7 %✅ Mesuré
142nova-micro-v1Amazon🔒 Propriétaire14,0 %✅ Mesuré
143inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.12,0 %21 avril 2026✅ Mesuré
144weavermancer▫ n.d.4,0 %✅ Mesuré
145nova-premier-v1Amazon🔒 Propriétaire3,0 %✅ Mesuré
146Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert0,0 %1 avril 2026✅ Mesuré
147Command A+Cohere🟢 Ouvert0,0 %20 mai 2026✅ Mesuré
148Inflection: Inflection 3 PiInflection🔒 Propriétaire0,0 %11 octobre 2024✅ Mesuré
149Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire0,0 %11 octobre 2024✅ Mesuré
150Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.0,0 %10 juillet 2026✅ Mesuré
151Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.0,0 %10 juillet 2026✅ Mesuré
152Meta: Llama Guard 4 12BMeta🟢 Ouvert0,0 %30 avril 2025✅ Mesuré
153Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert0,0 %28 août 2025✅ Mesuré
154Reka Flash 3Reka AI🟢 Ouvert0,0 %12 mars 2025✅ Mesuré
155Tencent: Hunyuan A13B InstructTencent🟢 Ouvert0,0 %8 juillet 2025✅ Mesuré
156WizardLM-2 8x22BMicrosoft🟢 Ouvert0,0 %16 avril 2024✅ Mesuré
157aion-rp-llama-3.1-8bAion Labs▫ n.d.0,0 %✅ Mesuré
158gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire0,0 %12 mars 2025✅ Mesuré
159gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire0,0 %12 mars 2025✅ Mesuré
160laguna-m.1poolside▫ n.d.0,0 %✅ Mesuré
161mythomax-l2-13bgryphe▫ n.d.0,0 %✅ Mesuré
162nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert0,0 %28 octobre 2025✅ Mesuré
163olmo-3-32b-thinkallenai▫ n.d.0,0 %✅ Mesuré
164remm-slerp-l2-13bundi95▫ n.d.0,0 %✅ Mesuré

Classement établi sur 164 modèles évalués, dont 69 de grands éditeurs. Score médian de l'ensemble : 62,0 %.

Notre analyse

Un score élevé indique qu’un modèle respecte littéralement les contraintes demandées, y compris lorsque leur nombre et leur imbrication augmentent. La correspondance exacte est particulièrement rigoureuse : une réponse globalement correcte peut échouer si son texte ne satisfait pas entièrement le format, l’ordre ou les conditions imposées. Les scores étant au moins partiellement mesurés par un tiers, leur fiabilité ne repose pas uniquement sur des résultats auto-déclarés. Le classement met en évidence une forte dispersion entre la médiane de l’ensemble et DeepSeek R1 Distill Llama 70B, qui atteint la conformité maximale. Ce résultat signale aussi un risque de saturation au sommet, puisque le benchmark ne peut plus départager les modèles obtenant 100 %. Sa portée reste centrée sur le suivi d’instructions en anglais et sur l’Exact Match, plutôt que sur une évaluation générale des capacités. Enfin, le caractère public du jeu implique un risque de contamination par exposition préalable aux tâches, ce qui invite à interpréter les meilleurs scores avec prudence.


Sources des scores : benchable.