Hallucinations (Baseline)

Benchable : Hallucinations (Baseline) est un benchmark créé par Benchable pour évaluer l’humilité épistémique des modèles d’IA. Il vérifie leur capacité à reconnaître l’incertitude face à des concepts, événements ou entités entièrement fictifs, plutôt qu’à produire une réponse inventée.

Benchable : Hallucinations (Baseline) est un benchmark créé par Benchable pour évaluer l’humilité épistémique des modèles d’IA. Il vérifie leur capacité à reconnaître l’incertitude face à des concepts, événements ou entités entièrement fictifs, plutôt qu’à produire une réponse inventée.

L’épreuve repose sur des QCM en anglais dans lesquels « Je ne sais pas » constitue systématiquement la bonne réponse. Elle fournit ainsi un indicateur ciblé de résistance aux hallucinations, utile pour comparer la prudence des modèles lorsqu’une question repose sur de fausses prémisses.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBenchable
Capacités mesuréesHumilite epistemique / resistance aux hallucinations : reconnaitre l'incertitude face a des concepts, evenements ou entites entierement fictifs
ModalitéTexte
Type de questionsQCM (A/B/C/D) ou 'Je ne sais pas' est toujours la bonne reponse
Métrique d'évaluationExactitude (100% = aucune hallucination, le modele repond correctement 'Je ne sais pas')
AccèsPublic
Languesanglais
Taille du jeu50 questions
RessourcesSite / dépôt officiel

Classement des modèles (147)

#ModèleÉditeurLicenceScoreSortieFiabilité
1AionLabs: Aion-2.0Aion Labs▫ n.d.100,0 %23 février 2026✅ Mesuré
2AionLabs: Aion-3.0Aion Labs▫ n.d.100,0 %7 juillet 2026✅ Mesuré
3Arcee AI: Virtuoso LargeArcee AI▫ n.d.100,0 %5 mai 2025✅ Mesuré
4Claude Haiku 4.5Anthropic🔒 Propriétaire100,0 %15 octobre 2025✅ Mesuré
5Claude Opus 4Anthropic🔒 Propriétaire100,0 %22 mai 2025✅ Mesuré
6Claude Opus 4.1Anthropic🔒 Propriétaire100,0 %5 août 2025✅ Mesuré
7Claude Sonnet 4Anthropic🔒 Propriétaire100,0 %22 mai 2025✅ Mesuré
8Claude Sonnet 4.5Anthropic🔒 Propriétaire100,0 %29 septembre 2025✅ Mesuré
9Deep Cogito: Cogito v2.1 671BDeep Cogito▫ n.d.100,0 %13 novembre 2025✅ Mesuré
10DeepSeek V3.1 TerminusDeepSeek🟢 Ouvert100,0 %22 septembre 2025✅ Mesuré
11GPT-4oOpenAI🔒 Propriétaire100,0 %27 mars 2025✅ Mesuré
12GPT-5 miniOpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
13GPT-5 nanoOpenAI🔒 Propriétaire100,0 %7 août 2025✅ Mesuré
14GPT-5.1OpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
15GPT-5.2OpenAI🔒 Propriétaire100,0 %11 décembre 2025✅ Mesuré
16Gemini 3.1 Pro PreviewGoogle▫ n.d.100,0 %19 février 2026✅ Mesuré
17Google: Gemini 3.1 Pro Preview Custom ToolsGoogle▫ n.d.100,0 %25 février 2026✅ Mesuré
18Kwaipilot: KAT-Coder-Pro V2kwaipilot▫ n.d.100,0 %27 mars 2026✅ Mesuré
19Magnum v4 72Banthracite-org🟢 Ouvert100,0 %22 octobre 2024✅ Mesuré
20Mistral LargeMistral AI▫ n.d.100,0 %26 février 2024✅ Mesuré
21Mistral Large 2407Mistral AI▫ n.d.100,0 %19 novembre 2024✅ Mesuré
22Mistral: Mistral Medium 3Mistral AI▫ n.d.100,0 %7 mai 2025✅ Mesuré
23Mistral: Mistral Medium 3.1Mistral AI▫ n.d.100,0 %13 août 2025✅ Mesuré
24Mistral: Mixtral 8x22B InstructMistral AI🟢 Ouvert100,0 %17 avril 2024✅ Mesuré
25Nous: Hermes 4 405BNous Research🟢 Ouvert100,0 %26 août 2025✅ Mesuré
26OpenAI: GPT-5.1 ChatOpenAI🔒 Propriétaire100,0 %13 novembre 2025✅ Mesuré
27OpenAI: GPT-5.2 ChatOpenAI🔒 Propriétaire100,0 %10 décembre 2025✅ Mesuré
28OpenAI: GPT-5.4 Image 2OpenAI🔒 Propriétaire100,0 %21 avril 2026✅ Mesuré
29Qwen: Qwen3 Coder PlusAlibaba Cloud / Qwen Team▫ n.d.100,0 %23 septembre 2025✅ Mesuré
30Qwen: Qwen3.6 Max PreviewAlibaba Cloud / Qwen Team▫ n.d.100,0 %27 avril 2026✅ Mesuré
31Sakana: Fugu UltraSakana AI▫ n.d.100,0 %24 juin 2026✅ Mesuré
32Seed 1.6ByteDance Seed▫ n.d.100,0 %23 décembre 2025✅ Mesuré
33StepFun: Step 3.7 FlashStepFun🟢 Ouvert100,0 %28 mai 2026✅ Mesuré
34Writer: Palmyra X5Writer▫ n.d.100,0 %21 janvier 2026✅ Mesuré
35Z.ai: GLM 5 TurboZhipu AI▫ n.d.100,0 %15 mars 2026✅ Mesuré
36deepseek-chat-v3DeepSeek▫ n.d.100,0 %✅ Mesuré
37devstral-2512mistralai▫ n.d.100,0 %✅ Mesuré
38gemini-3.1-flash-imageGoogle▫ n.d.100,0 %✅ Mesuré
39gemini-3.1-flash-image-previewGoogle▫ n.d.100,0 %✅ Mesuré
40inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.100,0 %23 avril 2026✅ Mesuré
41inclusionAI: Ring-2.6-1TInclusionAI▫ n.d.100,0 %8 mai 2026✅ Mesuré
42kimi-k2.5-0127Moonshot AI▫ n.d.100,0 %✅ Mesuré
43nova-premier-v1Amazon🔒 Propriétaire100,0 %✅ Mesuré
44qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.100,0 %8 septembre 2025✅ Mesuré
45qwen3-next-80b-a3b-instruct-2509Alibaba Cloud / Qwen Team▫ n.d.100,0 %✅ Mesuré
46qwen3.6-plus-04-02Alibaba Cloud / Qwen Team▫ n.d.100,0 %2 avril 2026✅ Mesuré
47xAI: Grok Build 0.1xAI▫ n.d.100,0 %20 mai 2026✅ Mesuré
48AionLabs: Aion-3.0-MiniAion Labs▫ n.d.98,0 %7 juillet 2026✅ Mesuré
49Claude Opus 4.5Anthropic🔒 Propriétaire98,0 %24 novembre 2025✅ Mesuré
50Command A+Cohere🟢 Ouvert98,0 %20 mai 2026✅ Mesuré
51GPT-5OpenAI🔒 Propriétaire98,0 %7 août 2025✅ Mesuré
52GPT-5.6 LunaOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
53GPT-5.6 SolOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
54Hy3Tencent🟢 Ouvert98,0 %6 juillet 2026✅ Mesuré
55IBM: Granite 4.1 8BIBM🟢 Ouvert98,0 %30 avril 2026✅ Mesuré
56Nous: Hermes 4 70BNous Research🟢 Ouvert98,0 %26 août 2025✅ Mesuré
57OpenAI: GPT Chat LatestOpenAI🔒 Propriétaire98,0 %5 mai 2026✅ Mesuré
58OpenAI: GPT-5.6 Luna ProOpenAI🔒 Propriétaire98,0 %9 juillet 2026✅ Mesuré
59Qwen 3.5 PlusQwen▫ n.d.98,0 %16 février 2026✅ Mesuré
60Qwen: Qwen3 30B A3B Instruct 2507Alibaba Cloud / Qwen Team🟢 Ouvert98,0 %29 juillet 2025✅ Mesuré
61deepseek-chat-v3-0324DeepSeek▫ n.d.98,0 %✅ Mesuré
62deepseek-chat-v3.1DeepSeek▫ n.d.98,0 %✅ Mesuré
63gemini-3-pro-imageGoogle▫ n.d.98,0 %✅ Mesuré
64mistral-saba-2502mistralai▫ n.d.98,0 %✅ Mesuré
65o1OpenAI🔒 Propriétaire98,0 %17 décembre 2024✅ Mesuré
66qwen3-next-80b-a3b-thinking-2509Alibaba Cloud / Qwen Team▫ n.d.98,0 %✅ Mesuré
67Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.97,1 %25 février 2026✅ Mesuré
68Baidu: ERNIE 4.5 VL 424B A47B Baidu🟢 Ouvert96,0 %30 juin 2025✅ Mesuré
69GPT-4.1 nanoOpenAI🔒 Propriétaire96,0 %14 avril 2025✅ Mesuré
70GPT-5.6 TerraOpenAI🔒 Propriétaire96,0 %9 juillet 2026✅ Mesuré
71OpenAI: GPT-5.6 Sol ProOpenAI🔒 Propriétaire96,0 %9 juillet 2026✅ Mesuré
72Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.96,0 %27 avril 2026✅ Mesuré
73gemini-2.5-pro-preview-03-25Google▫ n.d.96,0 %✅ Mesuré
74hermes-3-llama-3.1-405bnousresearch▫ n.d.96,0 %✅ Mesuré
75mistral-small-24b-instruct-2501mistralai▫ n.d.96,0 %✅ Mesuré
76nova-pro-v1Amazon🔒 Propriétaire96,0 %✅ Mesuré
77qwen3-30b-a3b-04-28Alibaba Cloud / Qwen Team▫ n.d.96,0 %✅ Mesuré
78Thinking Machines: InklingThinking Machines🟢 Ouvert95,8 %17 juillet 2026✅ Mesuré
79Kimi K2Moonshot AI▫ n.d.94,0 %6 novembre 2025✅ Mesuré
80OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire94,0 %25 janvier 2024✅ Mesuré
81Qwen: Qwen3 Coder 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert94,0 %31 juillet 2025✅ Mesuré
82nova-micro-v1Amazon🔒 Propriétaire94,0 %✅ Mesuré
83qwen3-coder-next-2025-02-03Alibaba Cloud / Qwen Team🟢 Ouvert94,0 %4 février 2026✅ Mesuré
84DeepSeek V4 ProDeepSeek▫ n.d.93,1 %24 avril 2026✅ Mesuré
85Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert92,0 %1 avril 2026✅ Mesuré
86DeepSeek V4 FlashDeepSeek▫ n.d.92,0 %24 avril 2026✅ Mesuré
87gpt-5-chat-2025-08-07OpenAI🔒 Propriétaire92,0 %7 août 2025✅ Mesuré
88Kwaipilot: KAT-Coder-Air V2.5kwaipilot▫ n.d.91,7 %10 juillet 2026✅ Mesuré
89Kwaipilot: KAT-Coder-Pro V2.5kwaipilot▫ n.d.91,3 %10 juillet 2026✅ Mesuré
90Inflection: Inflection 3 PiInflection🔒 Propriétaire90,0 %11 octobre 2024✅ Mesuré
91OpenAI: GPT-5.6 Terra ProOpenAI🔒 Propriétaire90,0 %9 juillet 2026✅ Mesuré
92hermes-3-llama-3.1-70bnousresearch▫ n.d.90,0 %✅ Mesuré
93qwen3-32b-04-28Alibaba Cloud / Qwen Team▫ n.d.90,0 %✅ Mesuré
94skyfall-36b-v2thedrummer▫ n.d.90,0 %✅ Mesuré
95MiniMax M1MiniMax🟢 Ouvert89,8 %17 juin 2025✅ Mesuré
96uncensoredvenice▫ n.d.89,8 %✅ Mesuré
97Perceptron: Perceptron Mk1Perceptron▫ n.d.88,4 %12 mai 2026✅ Mesuré
98GPT-4.1OpenAI🔒 Propriétaire88,0 %14 avril 2025✅ Mesuré
99Inflection: Inflection 3 ProductivityInflection🔒 Propriétaire88,0 %11 octobre 2024✅ Mesuré
100OpenAI: GPT-5.1-Codex-MaxOpenAI🔒 Propriétaire88,0 %4 décembre 2025✅ Mesuré
101Relace: Relace Searchrelace▫ n.d.88,0 %8 décembre 2025✅ Mesuré
102llama-4-maverick-17b-128e-instructMeta▫ n.d.88,0 %✅ Mesuré
103Claude 3 HaikuAnthropic🔒 Propriétaire86,0 %13 mars 2024✅ Mesuré
104OpenAI: gpt-oss-safeguard-20bOpenAI🟢 Ouvert86,0 %29 octobre 2025✅ Mesuré
105Qwen: Qwen3 30B A3B Thinking 2507Alibaba Cloud / Qwen Team🟢 Ouvert84,0 %28 août 2025✅ Mesuré
106Tencent: Hy3 previewTencent🟢 Ouvert84,0 %22 avril 2026✅ Mesuré
107laguna-m.1poolside▫ n.d.84,0 %✅ Mesuré
108ByteDance Seed: Seed 1.6 FlashByteDance Seed▫ n.d.82,0 %23 décembre 2025✅ Mesuré
109Perplexity: Sonar Pro SearchPerplexity🔒 Propriétaire80,0 %30 octobre 2025✅ Mesuré
110nemotron-nano-12b-v2-vlNVIDIA🟢 Ouvert80,0 %28 octobre 2025✅ Mesuré
111Qwen: Qwen3 Coder FlashAlibaba Cloud / Qwen Team▫ n.d.78,0 %17 septembre 2025✅ Mesuré
112command-r-plus-08-2024Cohere▫ n.d.78,0 %✅ Mesuré
113olmo-3-32b-thinkallenai▫ n.d.78,0 %✅ Mesuré
114GPT-4o miniOpenAI🔒 Propriétaire76,0 %18 juillet 2024✅ Mesuré
115unslopnemo-12bthedrummer▫ n.d.74,0 %✅ Mesuré
116cydonia-24b-v4.1thedrummer▫ n.d.72,7 %✅ Mesuré
117Mistral: Voxtral Small 24B 2507Mistral AI🟢 Ouvert72,0 %30 octobre 2025✅ Mesuré
118laguna-xs-2.1poolside▫ n.d.72,0 %✅ Mesuré
119GPT-4.1 miniOpenAI🔒 Propriétaire70,0 %14 avril 2025✅ Mesuré
120Nex AGI: Nex-N2-ProNex AGI🟢 Ouvert68,0 %8 juin 2026✅ Mesuré
121llama-4-scout-17b-16e-instructMeta▫ n.d.68,0 %✅ Mesuré
122mistral-small-2603mistralai▫ n.d.66,0 %✅ Mesuré
123ui-tars-1.5-7bByteDance▫ n.d.64,0 %✅ Mesuré
124Mistral NeMoMistral AI▫ n.d.62,0 %18 juillet 2024✅ Mesuré
125OpenAI: GPT-3.5 Turbo InstructOpenAI🔒 Propriétaire60,0 %28 septembre 2023✅ Mesuré
126Nex AGI: Nex-N2-MiniNex AGI🟢 Ouvert58,0 %24 juin 2026✅ Mesuré
127granite-4.0-h-microIBM🟢 Ouvert57,5 %20 octobre 2025✅ Mesuré
128ByteDance Seed: Seed-2.0-MiniByteDance Seed▫ n.d.56,0 %26 février 2026✅ Mesuré
129MiniMax: MiniMax-01MiniMax🟢 Ouvert56,0 %15 janvier 2025✅ Mesuré
130Cohere: Command R7B (12-2024)Cohere▫ n.d.54,0 %14 décembre 2024✅ Mesuré
131AI21: Jamba Large 1.7AI21 Labs🟢 Ouvert52,0 %8 août 2025✅ Mesuré
132MiniMax: MiniMax M2-herMiniMax▫ n.d.52,0 %23 janvier 2026✅ Mesuré
133SonarPerplexity🔒 Propriétaire52,0 %29 janvier 2025✅ Mesuré
134Upstage: Solar Pro 3Upstage▫ n.d.52,0 %27 janvier 2026✅ Mesuré
135l3-lunaris-8bsao10k▫ n.d.52,0 %✅ Mesuré
136inclusionAI: Ling-2.6-flashInclusionAI▫ n.d.50,0 %21 avril 2026✅ Mesuré
137nova-2-lite-v1Amazon🔒 Propriétaire46,0 %2 décembre 2025✅ Mesuré
138Cohere: Command R (08-2024)Cohere🟢 Ouvert44,0 %30 août 2024✅ Mesuré
139gpt-4o-mini-search-preview-2025-03-11OpenAI🔒 Propriétaire28,0 %12 mars 2025✅ Mesuré
140qwen3-14b-04-28Alibaba Cloud / Qwen Team▫ n.d.28,0 %✅ Mesuré
141reka-edge-2603Reka AI▫ n.d.16,0 %✅ Mesuré
142aion-rp-llama-3.1-8bAion Labs▫ n.d.2,0 %✅ Mesuré
143gemini-3-pro-image-previewGoogle▫ n.d.0,0 %✅ Mesuré
144ministral-14b-2512mistralai▫ n.d.0,0 %✅ Mesuré
145ministral-3b-2512mistralai▫ n.d.0,0 %✅ Mesuré
146ministral-8b-2512mistralai▫ n.d.0,0 %✅ Mesuré
147mistral-large-2512mistralai▫ n.d.0,0 %✅ Mesuré

Classement établi sur 147 modèles évalués, dont 63 de grands éditeurs. Score médian de l'ensemble : 96,0 %.

Notre analyse

Un score élevé signifie que le modèle choisit fréquemment « Je ne sais pas » devant des informations totalement inventées. Un résultat de 100 % correspond à l’absence d’hallucination sur les 50 questions du jeu. La fiabilité bénéficie de scores au moins partiellement mesurés par un tiers, ce qui apporte davantage de rigueur qu’une évaluation reposant uniquement sur des résultats auto-déclarés.

Le score médian de 96 % parmi 235 modèles et le résultat parfait d’AionLabs: Aion-2.0 montrent une forte concentration près du plafond. Cette saturation réduit la capacité du benchmark à départager finement les meilleurs modèles. Son accès public peut aussi favoriser une exposition préalable aux questions, un facteur de contamination à considérer dans l’interprétation. Sa portée reste ciblée : il mesure une réaction à des prémisses entièrement fictives, en anglais, avec une réponse correcte toujours identique. Le classement révèle donc surtout la propension des modèles à exprimer leur incertitude dans ce cadre précis, plutôt qu’une mesure générale de leur exactitude factuelle.


Sources des scores : benchable.