Ethics (Baseline)

Benchable : Ethics (Baseline) est un benchmark public créé par Benchable pour évaluer le raisonnement éthique des modèles d’IA. Il couvre l’éthique professionnelle, l’éthique de la recherche, l’éthique des technologies et le raisonnement moral.

Benchable : Ethics (Baseline) est un benchmark public créé par Benchable pour évaluer le raisonnement éthique des modèles d’IA. Il couvre l’éthique professionnelle, l’éthique de la recherche, l’éthique des technologies et le raisonnement moral.

L’épreuve repose sur des QCM en anglais, conçus de façon qu’une seule option corresponde à la réponse clairement éthique selon des principes établis. La validation exacte de la lettre choisie permet de comparer directement la capacité des modèles à identifier cette réponse dans des situations encadrées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesRaisonnement ethique : ethique professionnelle, ethique de la recherche, ethique des technologies, raisonnement moral
ModalitéTexte
Type de questionsQCM (4 options A/B/C/D)
Métrique d'évaluationChoix ethique correct (Exact Match, JSON Path $.answer)
AccèsPublic
Languesanglais
Taille du jeu100 questions
RessourcesSite / dépôt officiel

Classement des modèles (160)

#ModèleÉditeurLicenceScoreSortieFiabilité
1AionLabs: Aion-2.0Aion Labs▫ n.d.100,0 %23 février 2026✅ Mesuré
2AionLabs: Aion-3.0Aion Labs▫ n.d.100,0 %7 juillet 2026✅ Mesuré
3AionLabs: Aion-3.0-MiniAion Labs▫ n.d.100,0 %7 juillet 2026✅ Mesuré
4Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert100,0 %1 avril 2026✅ Mesuré
5Arcee AI: Virtuoso LargeArcee AI▫ n.d.100,0 %5 mai 2025✅ Mesuré
6Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert100,0 %30 juin 2025✅ Mesuré
7ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.100,0 %23 décembre 2025✅ Mesuré
8Claude Haiku 4.5Anthropic🔒 Propriétaire100,0 %15 octobre 2025✅ Mesuré
9Claude Opus 4Anthropic🔒 Propriétaire100,0 %22 mai 2025✅ Mesuré
10Claude Opus 4.1Anthropic🔒 Propriétaire100,0 %5 août 2025✅ Mesuré
11Claude Opus 4.5Anthropic🔒 Propriétaire100,0 %24 novembre 2025✅ Mesuré
12Claude Sonnet 4Anthropic🔒 Propriétaire100,0 %22 mai 2025✅ Mesuré
13Claude Sonnet 4.5Anthropic🔒 Propriétaire100,0 %29 septembre 2025✅ Mesuré
14Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.100,0 %13 novembre 2025✅ Mesuré
15DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert100,0 %22 septembre 2025✅ Mesuré
16DeepSeek V4 FlashDeepSeek▫ n.d.100,0 %24 avril 2026✅ Mesuré
17GPT-4OpenAI🔒 Propriétaire100,0 %28 août 2023✅ Mesuré
18GPT-4.1OpenAI🔒 Propriétaire100,0 %14 avril 2025✅ Mesuré
19GPT-4.1 miniOpenAI🔒 Propriétaire100,0 %14 avril 2025✅ Mesuré
20GPT-4.1 nanoOpenAI🔒 Propriétaire100,0 %14 avril 2025✅ Mesuré
21GPT-4oOpenAI🔒 Propriétaire100,0 %27 mars 2025✅ Mesuré
22GPT-4o miniOpenAI🔒 Propriétaire100,0 %18 juillet 2024✅ Mesuré
23GPT-5OpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
24GPT-5.1OpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
25GPT-5.2OpenAI🔒 Propriétaire100,0 %11 décembre 2025✅ Mesuré
26GPT-5.6 SolOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
27Gemini 3.1 Pro PreviewGoogle▫ n.d.100,0 %19 février 2026✅ Mesuré
28Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.100,0 %25 février 2026✅ Mesuré
29Kimi K2Moonshot AI▫ n.d.100,0 %6 novembre 2025✅ Mesuré
30Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.100,0 %10 juillet 2026✅ Mesuré
31Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.100,0 %10 juillet 2026✅ Mesuré
32Magnum v4 72Banthracite-org🟢 Ouvert100,0 %22 octobre 2024✅ Mesuré
33MiniMax: MiniMax-01MiniMax🟢 Ouvert100,0 %15 janvier 2025✅ Mesuré
34Mistral LargeMistral AI▫ n.d.100,0 %26 février 2024✅ Mesuré
35Mistral NeMoMistral AI▫ n.d.100,0 %18 juillet 2024✅ Mesuré
36Mistral: Mistral Medium 3Mistral AI▫ n.d.100,0 %7 mai 2025✅ Mesuré
37Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert100,0 %8 juin 2026✅ Mesuré
38Nous: Hermes 4 405BNous Research🟢 Ouvert100,0 %26 août 2025✅ Mesuré
39OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
40OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire100,0 %4 décembre 2025✅ Mesuré
41OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire100,0 %21 avril 2026✅ Mesuré
42OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire100,0 %9 juillet 2026✅ Mesuré
43Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert100,0 %29 juillet 2025✅ Mesuré
44Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert100,0 %28 août 2025✅ Mesuré
45Sonar ProPerplexity🔒 Propriétaire100,0 %7 mars 2025✅ Mesuré
46StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
47Tencent: Hy3 previewTencent🟢 Ouvert100,0 %22 avril 2026✅ Mesuré
48Thinking Machines: InklingThinking Machines🟢 Ouvert100,0 %17 juillet 2026✅ Mesuré
49Writer: Palmyra X5Writer▫ n.d.100,0 %21 janvier 2026✅ Mesuré
50Z.ai: GLM 5 TurboZhipu AI▫ n.d.100,0 %15 mars 2026✅ Mesuré
51deepseek-chat-v3DeepSeek▫ n.d.100,0 %✅ Mesuré
52deepseek-chat-v3-0324DeepSeek▫ n.d.100,0 %✅ Mesuré
53deepseek-chat-v3.1DeepSeek▫ n.d.100,0 %✅ Mesuré
54gemini-2.5-pro-preview-03-25Google▫ n.d.100,0 %✅ Mesuré
55gemini-3-pro-imageGoogle▫ n.d.100,0 %✅ Mesuré
56gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
57hermes-3-llama-3.1-405bnousresearch▫ n.d.100,0 %✅ Mesuré
58inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.100,0 %23 avril 2026✅ Mesuré
59inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.100,0 %8 mai 2026✅ Mesuré
60kimi-k2.5-0127Moonshot AI▫ n.d.100,0 %✅ Mesuré
61laguna-xs-2.1poolside▫ n.d.100,0 %✅ Mesuré
62llama-4-maverick-17b-128e-instructMeta▫ n.d.100,0 %✅ Mesuré
63mistral-saba-2502mistralai▫ n.d.100,0 %✅ Mesuré
64nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert100,0 %28 octobre 2025✅ Mesuré
65nova-2-lite-v1Amazon🔒 Propriétaire100,0 %2 décembre 2025✅ Mesuré
66qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.100,0 %8 septembre 2025✅ Mesuré
67qwen3-235b-a22b-07-25Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
68qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
69qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
70qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert100,0 %4 février 2026✅ Mesuré
71qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
72qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
73xAI: Grok Build 0.1xAI▫ n.d.100,0 %20 mai 2026✅ Mesuré
74AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert99,0 %8 août 2025✅ Mesuré
75GPT-5.6 LunaOpenAI🔒 Propriétaire99,0 %9 juillet 2026✅ Mesuré
76GPT-5.6 TerraOpenAI🔒 Propriétaire99,0 %9 juillet 2026✅ Mesuré
77IBM: Granite 4.1 8BIBM🟢 Ouvert99,0 %30 avril 2026✅ Mesuré
78MiniMax M1MiniMax🟢 Ouvert99,0 %17 juin 2025✅ Mesuré
79Mistral Large 2407Mistral AI▫ n.d.99,0 %19 novembre 2024✅ Mesuré
80Mistral: Mistral Medium 3.1Mistral AI▫ n.d.99,0 %13 août 2025✅ Mesuré
81Nous: Hermes 4 70BNous Research🟢 Ouvert99,0 %26 août 2025✅ Mesuré
82OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire99,0 %5 mai 2026✅ Mesuré
83OpenAI: GPT-3.5 Turbo 16kOpenAI🔒 Propriétaire99,0 %28 août 2023✅ Mesuré
84OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire99,0 %10 décembre 2025✅ Mesuré
85OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire99,0 %9 juillet 2026✅ Mesuré
86OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire99,0 %9 juillet 2026✅ Mesuré
87Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire99,0 %30 octobre 2025✅ Mesuré
88Seed 1.6ByteDance Seed▫ n.d.99,0 %23 décembre 2025✅ Mesuré
89SonarPerplexity🔒 Propriétaire99,0 %29 janvier 2025✅ Mesuré
90Upstage: Solar Pro 3Upstage▫ n.d.99,0 %27 janvier 2026✅ Mesuré
91command-r-plus-08-2024Cohere▫ n.d.99,0 %✅ Mesuré
92gemini-3.1-flash-image-previewGoogle▫ n.d.99,0 %✅ Mesuré
93gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire99,0 %12 mars 2025✅ Mesuré
94gpt-4o-search-preview-2025-03-11OpenAI🔒 Propriétaire99,0 %12 mars 2025✅ Mesuré
95laguna-m.1poolside▫ n.d.99,0 %✅ Mesuré
96ministral-14b-2512mistralai▫ n.d.99,0 %✅ Mesuré
97mistral-large-2512mistralai▫ n.d.99,0 %✅ Mesuré
98mistral-small-2603mistralai▫ n.d.99,0 %✅ Mesuré
99nova-pro-v1Amazon🔒 Propriétaire99,0 %✅ Mesuré
100qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
101qwen3-235b-a22b-04-28Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
102qwen3-8b-04-28Alibaba Cloud / Qwen Team▫ n.d.99,0 %✅ Mesuré
103skyfall-36b-v2thedrummer▫ n.d.99,0 %✅ Mesuré
104ui-tars-1.5-7bByteDance▫ n.d.99,0 %✅ Mesuré
105uncensoredvenice▫ n.d.99,0 %✅ Mesuré
106Claude 3 HaikuAnthropic🔒 Propriétaire98,0 %13 mars 2024✅ Mesuré
107Command A+Cohere🟢 Ouvert98,0 %20 mai 2026✅ Mesuré
108GPT-5 miniOpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
109GPT-5 nanoOpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
110Inflection: Inflection 3 PiInflection🔒 Propriétaire98,0 %11 octobre 2024✅ Mesuré
111Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire98,0 %11 octobre 2024✅ Mesuré
112Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert98,0 %30 octobre 2025✅ Mesuré
113OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert98,0 %29 octobre 2025✅ Mesuré
114Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert98,0 %31 juillet 2025✅ Mesuré
115Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.98,0 %17 septembre 2025✅ Mesuré
116WizardLM-2 8x22BMicrosoft🟢 Ouvert98,0 %16 avril 2024✅ Mesuré
117cydonia-24b-v4.1thedrummer▫ n.d.98,0 %✅ Mesuré
118hermes-3-llama-3.1-70bnousresearch▫ n.d.98,0 %✅ Mesuré
119llama-4-scout-17b-16e-instructMeta▫ n.d.98,0 %✅ Mesuré
120ministral-3b-2512mistralai▫ n.d.98,0 %✅ Mesuré
121mistral-small-24b-instruct-2501mistralai▫ n.d.98,0 %✅ Mesuré
122nova-micro-v1Amazon🔒 Propriétaire98,0 %✅ Mesuré
123o1OpenAI🔒 Propriétaire98,0 %17 décembre 2024✅ Mesuré
124olmo-3-32b-thinkallenai▫ n.d.98,0 %✅ Mesuré
125rocinante-12bthedrummer▫ n.d.98,0 %✅ Mesuré
126granite-4.0-h-microIBM🟢 Ouvert97,8 %20 octobre 2025✅ Mesuré
127ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.97,0 %26 février 2026✅ Mesuré
128Cohere: Command R (08-2024)Cohere🟢 Ouvert97,0 %30 août 2024✅ Mesuré
129Mistral: Codestral 2508Mistral AI▫ n.d.97,0 %1 août 2025✅ Mesuré
130OpenAI: GPT-3.5 Turbo InstructOpenAI🔒 Propriétaire97,0 %28 septembre 2023✅ Mesuré
131ministral-8b-2512mistralai▫ n.d.97,0 %✅ Mesuré
132Perceptron: Perceptron Mk1Perceptron▫ n.d.96,8 %12 mai 2026✅ Mesuré
133DeepSeek V4 ProDeepSeek▫ n.d.96,0 %24 avril 2026✅ Mesuré
134Relace: Relace Searchrelace▫ n.d.96,0 %8 décembre 2025✅ Mesuré
135devstral-2512mistralai▫ n.d.96,0 %✅ Mesuré
136reka-edge-2603Reka AI▫ n.d.96,0 %✅ Mesuré
137Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert95,0 %17 avril 2024✅ Mesuré
138Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.94,0 %27 mars 2026✅ Mesuré
139unslopnemo-12bthedrummer▫ n.d.94,0 %✅ Mesuré
140Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert93,0 %24 juin 2026✅ Mesuré
141gemini-3.1-flash-imageGoogle▫ n.d.92,0 %✅ Mesuré
142Cohere: Command R7B (12-2024)Cohere▫ n.d.90,0 %14 décembre 2024✅ Mesuré
143Muse Spark 1.1Meta🔒 Propriétaire84,0 %9 juillet 2026✅ Mesuré
144l3-lunaris-8bsao10k▫ n.d.68,5 %✅ Mesuré
145MiniMax: MiniMax M2-herMiniMax▫ n.d.61,0 %23 janvier 2026✅ Mesuré
146l3.3-euryale-70b-v2.3sao10k▫ n.d.53,0 %✅ Mesuré
147Hy3Tencent🟢 Ouvert45,9 %6 juillet 2026✅ Mesuré
148inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.44,0 %21 avril 2026✅ Mesuré
149l3.1-euryale-70bsao10k▫ n.d.42,0 %✅ Mesuré
150aion-rp-llama-3.1-8bAion Labs▫ n.d.14,0 %✅ Mesuré
151remm-slerp-l2-13bundi95▫ n.d.2,0 %✅ Mesuré
152mythomax-l2-13bgryphe▫ n.d.1,0 %✅ Mesuré
153Meta: Llama 3.2 1B InstructMeta🟢 Ouvert0,0 %25 septembre 2024✅ Mesuré
154Meta: Llama Guard 4 12BMeta🟢 Ouvert0,0 %30 avril 2025✅ Mesuré
155Qwen 3.5 PlusQwen▫ n.d.0,0 %16 février 2026✅ Mesuré
156Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %25 février 2026✅ Mesuré
157Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.0,0 %27 avril 2026✅ Mesuré
158nova-premier-v1Amazon🔒 Propriétaire0,0 %✅ Mesuré
159qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.0,0 %2 avril 2026✅ Mesuré
160weavermancer▫ n.d.0,0 %✅ Mesuré

Classement établi sur 160 modèles évalués, dont 69 de grands éditeurs. Score médian de l'ensemble : 99,0 %.

Notre analyse

Un score élevé indique qu’un modèle sélectionne très régulièrement l’option considérée comme clairement éthique par le benchmark. La validation par Exact Match impose une réponse conforme au format attendu, mais elle mesure avant tout le choix final, et non la qualité d’une justification morale détaillée. La fiabilité bénéficie de scores au moins partiellement mesurés par un tiers, ce qui apporte davantage de contrôle qu’une évaluation uniquement auto-déclarée.

Avec un score médian de 99 % parmi 253 modèles et un meilleur résultat de 100 % pour AionLabs: Aion-2.0, le classement apparaît fortement saturé. Il distingue donc difficilement les modèles les plus performants, un faible nombre d’erreurs pouvant suffire à modifier leur position. Le caractère public du jeu crée aussi un risque de contamination ou de familiarisation avec les questions. Enfin, sa portée reste celle de QCM à réponse unique en anglais : les résultats reflètent la reconnaissance d’un choix éthique établi dans ce cadre, sur les quatre domaines couverts, plutôt qu’une mesure générale de tout raisonnement moral possible.


Sources des scores : benchable.