GPQA diamond

Epoch: GPQA diamond est un benchmark créé par D. Rein et al. pour évaluer des modèles sur des questions scientifiques à choix multiple de niveau doctorat. Son contenu mobilise notamment des connaissances avancées en biologie, en chimie et en physique.

Epoch: GPQA diamond est un benchmark créé par D. Rein et al. pour évaluer des modèles sur des questions scientifiques à choix multiple de niveau doctorat. Son contenu mobilise notamment des connaissances avancées en biologie, en chimie et en physique.

Ce sous-ensemble particulièrement sélectif de GPQA cible des problèmes conçus pour résister à une simple recherche sur le web. Il sert ainsi à comparer la capacité des modèles à conjuguer expertise scientifique approfondie, compréhension des questions et raisonnement robuste afin de sélectionner une réponse correcte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkD. Rein et al.
Capacités mesuréesÉvalue la capacité à répondre à des questions scientifiques de niveau doctorat nécessitant une expertise approfondie et un raisonnement robuste.
ModalitéTexte
Type de questionsQCM
Métrique d'évaluationaccuracy
AccèsPublic
LicenceCC-BY-4.0
Languesanglais
Taille du jeu198 questions (sous-ensemble GPQA Diamond)
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (85)

#ModèleÉditeurLicenceScoreSortieFiabilité
1OpenAI: GPT-5.4 ProOpenAI🔒 Propriétaire94,6 %5 mars 2026✅ Mesuré
2Gemini 3.1 Pro PreviewGoogle▫ n.d.94,1 %19 février 2026✅ Mesuré
3GPT-5.6 SolOpenAI🔒 Propriétaire93,5 %9 juillet 2026✅ Mesuré
4Grok 4.5xAI🔒 Propriétaire93,4 %16 juillet 2026✅ Mesuré
5GPT-5.6 TerraOpenAI🔒 Propriétaire93,3 %9 juillet 2026✅ Mesuré
6GPT-5.6 LunaOpenAI🔒 Propriétaire91,6 %9 juillet 2026✅ Mesuré
7GPT-5.2OpenAI🔒 Propriétaire91,4 %11 décembre 2025✅ Mesuré
8DeepSeek V4 ProDeepSeek▫ n.d.89,6 %24 avril 2026✅ Mesuré
9Grok 4.20xAI▫ n.d.89,3 %31 mars 2026✅ Mesuré
10Qwen 3.6 MaxQwen▫ n.d.89,1 %20 avril 2026✅ Mesuré
11Grok 4.3 BetaxAI▫ n.d.88,8 %17 avril 2026✅ Mesuré
12GPT-5.1OpenAI🔒 Propriétaire87,6 %13 novembre 2025✅ Mesuré
13GPT-5OpenAI🔒 Propriétaire86,2 %7 août 2025✅ Mesuré
14Claude Opus 4.5Anthropic🔒 Propriétaire86,0 %24 novembre 2025✅ Mesuré
15Gemini 2.5 Pro PreviewGoogle▫ n.d.84,8 %5 juin 2025✅ Mesuré
16Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.84,4 %27 avril 2026✅ Mesuré
17Kimi K2 Thinking TurboMoonshot AI▫ n.d.84,2 %6 novembre 2025✅ Mesuré
18Qwen 3.5 PlusQwen▫ n.d.84,2 %16 février 2026✅ Mesuré
19Gemini 2.5 Pro ExpGoogle▫ n.d.83,8 %25 mars 2025✅ Mesuré
20Qwen: Qwen3.5-FlashAlibaba Cloud / Qwen Team▫ n.d.83,8 %25 février 2026✅ Mesuré
21Claude Sonnet 4.5Anthropic🔒 Propriétaire82,3 %29 septembre 2025✅ Mesuré
22o3OpenAI🔒 Propriétaire81,8 %16 avril 2025✅ Mesuré
23Claude 3.7 SonnetAnthropic🔒 Propriétaire79,7 %24 février 2025✅ Mesuré
24Claude Sonnet 4Anthropic🔒 Propriétaire79,2 %22 mai 2025✅ Mesuré
25Claude Opus 4.1Anthropic🔒 Propriétaire77,3 %5 août 2025✅ Mesuré
26o1OpenAI🔒 Propriétaire76,8 %17 décembre 2024✅ Mesuré
27Claude Opus 4Anthropic🔒 Propriétaire76,3 %22 mai 2025✅ Mesuré
28GPT-5 miniOpenAI🔒 Propriétaire75,0 %7 août 2025✅ Mesuré
29Qwen3-Max-InstructQwen▫ n.d.72,6 %24 septembre 2025✅ Mesuré
30Claude Haiku 4.5Anthropic🔒 Propriétaire71,2 %15 octobre 2025✅ Mesuré
31GPT-5 nanoOpenAI🔒 Propriétaire69,4 %7 août 2025✅ Mesuré
32OpenAI: GPT-4.5 (Preview)OpenAI🔒 Propriétaire68,7 %27 février 2025✅ Mesuré
33GPT-4.1OpenAI🔒 Propriétaire66,9 %14 avril 2025✅ Mesuré
34GPT-4.1 miniOpenAI🔒 Propriétaire65,8 %14 avril 2025✅ Mesuré
35Gemini 2.0 Pro ExpGoogle▫ n.d.65,7 %5 février 2025✅ Mesuré
36QWQ-PlusQwen▫ n.d.65,4 %8 avril 2025✅ Mesuré
37Mistral: Mistral Medium 3Mistral AI▫ n.d.59,5 %7 mai 2025✅ Mesuré
38Gemini 2.0 Flash ExperimentalGoogle▫ n.d.57,1 %21 janvier 2025✅ Mesuré
39qwen2.5-maxQwen▫ n.d.56,1 %25 janvier 2025✅ Mesuré
40Claude 3.5 SonnetAnthropic🔒 Propriétaire55,3 %22 octobre 2024✅ Mesuré
41Llama 3.1-405BMeta▫ n.d.50,9 %23 juillet 2024✅ Mesuré
42GPT-4oOpenAI🔒 Propriétaire49,2 %27 mars 2025✅ Mesuré
43Qwen2.5-72BQwen▫ n.d.49,1 %19 septembre 2024✅ Mesuré
44GPT-4.1 nanoOpenAI🔒 Propriétaire48,9 %14 avril 2025✅ Mesuré
45Magistral Small 1.1Mistral AI▫ n.d.48,4 %10 juin 2025✅ Mesuré
46qwen-plus-2025-01-25Alibaba Cloud / Qwen Team▫ n.d.48,1 %8 septembre 2025✅ Mesuré
47Mistral Small 3.1Mistral AI▫ n.d.47,5 %17 mars 2025✅ Mesuré
48Llama 3.3 70BMeta▫ n.d.47,4 %6 décembre 2024✅ Mesuré
49Claude 3 OpusAnthropic🔒 Propriétaire47,2 %29 février 2024✅ Mesuré
50Tulu 3 (Tülu 3) 70BAllen Institute for AI▫ n.d.46,3 %21 novembre 2024✅ Mesuré
51Qwen2.5-32BQwen▫ n.d.46,1 %17 septembre 2024✅ Mesuré
52Mistral Small 3Mistral AI▫ n.d.45,3 %25 janvier 2025✅ Mesuré
53Llama 3.1-70BMeta▫ n.d.44,2 %23 juillet 2024✅ Mesuré
54WizardLM-2 8x22BMicrosoft🟢 Ouvert43,4 %16 avril 2024✅ Mesuré
55OpenAI: GPT-4 Turbo PreviewOpenAI🔒 Propriétaire42,4 %25 janvier 2024✅ Mesuré
56Qwen: Qwen-TurboAlibaba Cloud / Qwen Team▫ n.d.41,8 %1 février 2025✅ Mesuré
57Llama 3.2 90BMeta▫ n.d.41,0 %24 septembre 2024✅ Mesuré
58Qwen2-72BQwen▫ n.d.40,8 %7 juin 2024✅ Mesuré
59Claude 3 SonnetAnthropic🔒 Propriétaire40,6 %29 février 2024✅ Mesuré
60Llama 3-70BMeta▫ n.d.40,6 %18 avril 2024✅ Mesuré
61Mistral LargeMistral AI▫ n.d.38,8 %26 février 2024✅ Mesuré
62Claude 3.5 HaikuAnthropic🔒 Propriétaire38,1 %4 novembre 2024✅ Mesuré
63GPT-4o miniOpenAI🔒 Propriétaire37,7 %18 juillet 2024✅ Mesuré
64Hermes 2 Theta Llama-3 70BNous Research▫ n.d.37,5 %20 juin 2024✅ Mesuré
65Claude 3 HaikuAnthropic🔒 Propriétaire36,3 %13 mars 2024✅ Mesuré
66GPT-4OpenAI🔒 Propriétaire35,7 %28 août 2023✅ Mesuré
67Claude 2Anthropic🔒 Propriétaire34,7 %11 juillet 2023✅ Mesuré
68Mixtral 8x22BMistral AI▫ n.d.34,1 %17 avril 2024✅ Mesuré
69Eurus-2-7B-PRIMETsinghua University▫ n.d.33,9 %3 février 2025✅ Mesuré
70Claude 2.1Anthropic🔒 Propriétaire33,0 %21 novembre 2023✅ Mesuré
71DBRXDatabricks▫ n.d.32,9 %27 mars 2024✅ Mesuré
72Yi-1.5-34B01.AI▫ n.d.32,0 %13 mai 2024✅ Mesuré
73Qwen1.5-32BQwen▫ n.d.30,7 %3 avril 2024✅ Mesuré
74Mixtral 8x7BMistral AI▫ n.d.30,6 %11 décembre 2023✅ Mesuré
75Mistral NeMoMistral AI▫ n.d.29,9 %18 juillet 2024✅ Mesuré
76Qwen1.5-72BQwen▫ n.d.28,8 %4 février 2024✅ Mesuré
77phi-3-medium 14BMicrosoft▫ n.d.27,6 %23 avril 2024✅ Mesuré
78Mistral: Ministral 8BMistral AI▫ n.d.27,1 %17 octobre 2024✅ Mesuré
79Llama 2-70BMeta▫ n.d.26,3 %18 juillet 2023✅ Mesuré
80Llama 3-8BMeta▫ n.d.26,1 %18 avril 2024✅ Mesuré
81Llama 3.1-8BMeta▫ n.d.25,9 %23 juillet 2024✅ Mesuré
82Mistral: Ministral 3BMistral AI▫ n.d.25,3 %17 octobre 2024✅ Mesuré
83DeepSeek LLM 67BDeepSeek▫ n.d.24,6 %29 novembre 2023✅ Mesuré
84Mistral 7BMistral AI▫ n.d.15,2 %27 mai 2024✅ Mesuré
85Yi-34B01.AI▫ n.d.14,7 %2 novembre 2023✅ Mesuré

Classement établi sur 85 modèles évalués, dont 74 de grands éditeurs. Score médian de l'ensemble : 49,1 %.

Notre analyse

Un score élevé sur Epoch: GPQA diamond indique qu’un modèle répond correctement à une forte proportion de questions scientifiques avancées. Il traduit donc une performance solide en expertise et en raisonnement sur ce format QCM, sans constituer une mesure générale de toutes les capacités d’une IA. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt qu’exclusivement auto-déclarés.

Parmi les 137 modèles évalués, la médiane de 66 % et le meilleur score de 95 %, obtenu par OpenAI: GPT-5.4 Pro, montrent un écart substantiel entre le centre du classement et son sommet. Le niveau maximal proche du plafond suggère toutefois un risque de saturation pour les modèles les plus performants, ce qui peut réduire le pouvoir discriminant du benchmark à ce niveau. Sa portée reste circonscrite à 198 questions en anglais, dans certaines disciplines scientifiques et sous forme de QCM. Son accès public impose aussi de considérer le risque de contamination lors de l’interprétation des résultats, sans qu’il invalide à lui seul les scores observés.


Sources des scores : epoch.