GPQA diamond
Epoch: GPQA diamond est un benchmark créé par D. Rein et al. pour évaluer des modèles sur des questions scientifiques à choix multiple de niveau doctorat. Son contenu mobilise notamment des connaissances avancées en biologie, en chimie et en physique.
Epoch: GPQA diamond est un benchmark créé par D. Rein et al. pour évaluer des modèles sur des questions scientifiques à choix multiple de niveau doctorat. Son contenu mobilise notamment des connaissances avancées en biologie, en chimie et en physique.
Ce sous-ensemble particulièrement sélectif de GPQA cible des problèmes conçus pour résister à une simple recherche sur le web. Il sert ainsi à comparer la capacité des modèles à conjuguer expertise scientifique approfondie, compréhension des questions et raisonnement robuste afin de sélectionner une réponse correcte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | D. Rein et al. |
| Capacités mesurées | Évalue la capacité à répondre à des questions scientifiques de niveau doctorat nécessitant une expertise approfondie et un raisonnement robuste. |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | CC-BY-4.0 |
| Langues | anglais |
| Taille du jeu | 198 questions (sous-ensemble GPQA Diamond) |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (85)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | OpenAI: GPT-5.4 Pro | OpenAI | 🔒 Propriétaire | 94,6 % | 5 mars 2026 | ✅ Mesuré |
| 2 | Gemini 3.1 Pro Preview | ▫ n.d. | 94,1 % | 19 février 2026 | ✅ Mesuré | |
| 3 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 93,5 % | 9 juillet 2026 | ✅ Mesuré |
| 4 | Grok 4.5 | xAI | 🔒 Propriétaire | 93,4 % | 16 juillet 2026 | ✅ Mesuré |
| 5 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 93,3 % | 9 juillet 2026 | ✅ Mesuré |
| 6 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 91,6 % | 9 juillet 2026 | ✅ Mesuré |
| 7 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 91,4 % | 11 décembre 2025 | ✅ Mesuré |
| 8 | DeepSeek V4 Pro | DeepSeek | ▫ n.d. | 89,6 % | 24 avril 2026 | ✅ Mesuré |
| 9 | Grok 4.20 | xAI | ▫ n.d. | 89,3 % | 31 mars 2026 | ✅ Mesuré |
| 10 | Qwen 3.6 Max | Qwen | ▫ n.d. | 89,1 % | 20 avril 2026 | ✅ Mesuré |
| 11 | Grok 4.3 Beta | xAI | ▫ n.d. | 88,8 % | 17 avril 2026 | ✅ Mesuré |
| 12 | GPT-5.1 | OpenAI | 🔒 Propriétaire | 87,6 % | 13 novembre 2025 | ✅ Mesuré |
| 13 | GPT-5 | OpenAI | 🔒 Propriétaire | 86,2 % | 7 août 2025 | ✅ Mesuré |
| 14 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 86,0 % | 24 novembre 2025 | ✅ Mesuré |
| 15 | Gemini 2.5 Pro Preview | ▫ n.d. | 84,8 % | 5 juin 2025 | ✅ Mesuré | |
| 16 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 84,4 % | 27 avril 2026 | ✅ Mesuré |
| 17 | Kimi K2 Thinking Turbo | Moonshot AI | ▫ n.d. | 84,2 % | 6 novembre 2025 | ✅ Mesuré |
| 18 | Qwen 3.5 Plus | Qwen | ▫ n.d. | 84,2 % | 16 février 2026 | ✅ Mesuré |
| 19 | Gemini 2.5 Pro Exp | ▫ n.d. | 83,8 % | 25 mars 2025 | ✅ Mesuré | |
| 20 | Qwen: Qwen3.5-Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 83,8 % | 25 février 2026 | ✅ Mesuré |
| 21 | Claude Sonnet 4.5 | Anthropic | 🔒 Propriétaire | 82,3 % | 29 septembre 2025 | ✅ Mesuré |
| 22 | o3 | OpenAI | 🔒 Propriétaire | 81,8 % | 16 avril 2025 | ✅ Mesuré |
| 23 | Claude 3.7 Sonnet | Anthropic | 🔒 Propriétaire | 79,7 % | 24 février 2025 | ✅ Mesuré |
| 24 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 79,2 % | 22 mai 2025 | ✅ Mesuré |
| 25 | Claude Opus 4.1 | Anthropic | 🔒 Propriétaire | 77,3 % | 5 août 2025 | ✅ Mesuré |
| 26 | o1 | OpenAI | 🔒 Propriétaire | 76,8 % | 17 décembre 2024 | ✅ Mesuré |
| 27 | Claude Opus 4 | Anthropic | 🔒 Propriétaire | 76,3 % | 22 mai 2025 | ✅ Mesuré |
| 28 | GPT-5 mini | OpenAI | 🔒 Propriétaire | 75,0 % | 7 août 2025 | ✅ Mesuré |
| 29 | Qwen3-Max-Instruct | Qwen | ▫ n.d. | 72,6 % | 24 septembre 2025 | ✅ Mesuré |
| 30 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 71,2 % | 15 octobre 2025 | ✅ Mesuré |
| 31 | GPT-5 nano | OpenAI | 🔒 Propriétaire | 69,4 % | 7 août 2025 | ✅ Mesuré |
| 32 | OpenAI: GPT-4.5 (Preview) | OpenAI | 🔒 Propriétaire | 68,7 % | 27 février 2025 | ✅ Mesuré |
| 33 | GPT-4.1 | OpenAI | 🔒 Propriétaire | 66,9 % | 14 avril 2025 | ✅ Mesuré |
| 34 | GPT-4.1 mini | OpenAI | 🔒 Propriétaire | 65,8 % | 14 avril 2025 | ✅ Mesuré |
| 35 | Gemini 2.0 Pro Exp | ▫ n.d. | 65,7 % | 5 février 2025 | ✅ Mesuré | |
| 36 | QWQ-Plus | Qwen | ▫ n.d. | 65,4 % | 8 avril 2025 | ✅ Mesuré |
| 37 | Mistral: Mistral Medium 3 | Mistral AI | ▫ n.d. | 59,5 % | 7 mai 2025 | ✅ Mesuré |
| 38 | Gemini 2.0 Flash Experimental | ▫ n.d. | 57,1 % | 21 janvier 2025 | ✅ Mesuré | |
| 39 | qwen2.5-max | Qwen | ▫ n.d. | 56,1 % | 25 janvier 2025 | ✅ Mesuré |
| 40 | Claude 3.5 Sonnet | Anthropic | 🔒 Propriétaire | 55,3 % | 22 octobre 2024 | ✅ Mesuré |
| 41 | Llama 3.1-405B | Meta | ▫ n.d. | 50,9 % | 23 juillet 2024 | ✅ Mesuré |
| 42 | GPT-4o | OpenAI | 🔒 Propriétaire | 49,2 % | 27 mars 2025 | ✅ Mesuré |
| 43 | Qwen2.5-72B | Qwen | ▫ n.d. | 49,1 % | 19 septembre 2024 | ✅ Mesuré |
| 44 | GPT-4.1 nano | OpenAI | 🔒 Propriétaire | 48,9 % | 14 avril 2025 | ✅ Mesuré |
| 45 | Magistral Small 1.1 | Mistral AI | ▫ n.d. | 48,4 % | 10 juin 2025 | ✅ Mesuré |
| 46 | qwen-plus-2025-01-25 | Alibaba Cloud / Qwen Team | ▫ n.d. | 48,1 % | 8 septembre 2025 | ✅ Mesuré |
| 47 | Mistral Small 3.1 | Mistral AI | ▫ n.d. | 47,5 % | 17 mars 2025 | ✅ Mesuré |
| 48 | Llama 3.3 70B | Meta | ▫ n.d. | 47,4 % | 6 décembre 2024 | ✅ Mesuré |
| 49 | Claude 3 Opus | Anthropic | 🔒 Propriétaire | 47,2 % | 29 février 2024 | ✅ Mesuré |
| 50 | Tulu 3 (Tülu 3) 70B | Allen Institute for AI | ▫ n.d. | 46,3 % | 21 novembre 2024 | ✅ Mesuré |
| 51 | Qwen2.5-32B | Qwen | ▫ n.d. | 46,1 % | 17 septembre 2024 | ✅ Mesuré |
| 52 | Mistral Small 3 | Mistral AI | ▫ n.d. | 45,3 % | 25 janvier 2025 | ✅ Mesuré |
| 53 | Llama 3.1-70B | Meta | ▫ n.d. | 44,2 % | 23 juillet 2024 | ✅ Mesuré |
| 54 | WizardLM-2 8x22B | Microsoft | 🟢 Ouvert | 43,4 % | 16 avril 2024 | ✅ Mesuré |
| 55 | OpenAI: GPT-4 Turbo Preview | OpenAI | 🔒 Propriétaire | 42,4 % | 25 janvier 2024 | ✅ Mesuré |
| 56 | Qwen: Qwen-Turbo | Alibaba Cloud / Qwen Team | ▫ n.d. | 41,8 % | 1 février 2025 | ✅ Mesuré |
| 57 | Llama 3.2 90B | Meta | ▫ n.d. | 41,0 % | 24 septembre 2024 | ✅ Mesuré |
| 58 | Qwen2-72B | Qwen | ▫ n.d. | 40,8 % | 7 juin 2024 | ✅ Mesuré |
| 59 | Claude 3 Sonnet | Anthropic | 🔒 Propriétaire | 40,6 % | 29 février 2024 | ✅ Mesuré |
| 60 | Llama 3-70B | Meta | ▫ n.d. | 40,6 % | 18 avril 2024 | ✅ Mesuré |
| 61 | Mistral Large | Mistral AI | ▫ n.d. | 38,8 % | 26 février 2024 | ✅ Mesuré |
| 62 | Claude 3.5 Haiku | Anthropic | 🔒 Propriétaire | 38,1 % | 4 novembre 2024 | ✅ Mesuré |
| 63 | GPT-4o mini | OpenAI | 🔒 Propriétaire | 37,7 % | 18 juillet 2024 | ✅ Mesuré |
| 64 | Hermes 2 Theta Llama-3 70B | Nous Research | ▫ n.d. | 37,5 % | 20 juin 2024 | ✅ Mesuré |
| 65 | Claude 3 Haiku | Anthropic | 🔒 Propriétaire | 36,3 % | 13 mars 2024 | ✅ Mesuré |
| 66 | GPT-4 | OpenAI | 🔒 Propriétaire | 35,7 % | 28 août 2023 | ✅ Mesuré |
| 67 | Claude 2 | Anthropic | 🔒 Propriétaire | 34,7 % | 11 juillet 2023 | ✅ Mesuré |
| 68 | Mixtral 8x22B | Mistral AI | ▫ n.d. | 34,1 % | 17 avril 2024 | ✅ Mesuré |
| 69 | Eurus-2-7B-PRIME | Tsinghua University | ▫ n.d. | 33,9 % | 3 février 2025 | ✅ Mesuré |
| 70 | Claude 2.1 | Anthropic | 🔒 Propriétaire | 33,0 % | 21 novembre 2023 | ✅ Mesuré |
| 71 | DBRX | Databricks | ▫ n.d. | 32,9 % | 27 mars 2024 | ✅ Mesuré |
| 72 | Yi-1.5-34B | 01.AI | ▫ n.d. | 32,0 % | 13 mai 2024 | ✅ Mesuré |
| 73 | Qwen1.5-32B | Qwen | ▫ n.d. | 30,7 % | 3 avril 2024 | ✅ Mesuré |
| 74 | Mixtral 8x7B | Mistral AI | ▫ n.d. | 30,6 % | 11 décembre 2023 | ✅ Mesuré |
| 75 | Mistral NeMo | Mistral AI | ▫ n.d. | 29,9 % | 18 juillet 2024 | ✅ Mesuré |
| 76 | Qwen1.5-72B | Qwen | ▫ n.d. | 28,8 % | 4 février 2024 | ✅ Mesuré |
| 77 | phi-3-medium 14B | Microsoft | ▫ n.d. | 27,6 % | 23 avril 2024 | ✅ Mesuré |
| 78 | Mistral: Ministral 8B | Mistral AI | ▫ n.d. | 27,1 % | 17 octobre 2024 | ✅ Mesuré |
| 79 | Llama 2-70B | Meta | ▫ n.d. | 26,3 % | 18 juillet 2023 | ✅ Mesuré |
| 80 | Llama 3-8B | Meta | ▫ n.d. | 26,1 % | 18 avril 2024 | ✅ Mesuré |
| 81 | Llama 3.1-8B | Meta | ▫ n.d. | 25,9 % | 23 juillet 2024 | ✅ Mesuré |
| 82 | Mistral: Ministral 3B | Mistral AI | ▫ n.d. | 25,3 % | 17 octobre 2024 | ✅ Mesuré |
| 83 | DeepSeek LLM 67B | DeepSeek | ▫ n.d. | 24,6 % | 29 novembre 2023 | ✅ Mesuré |
| 84 | Mistral 7B | Mistral AI | ▫ n.d. | 15,2 % | 27 mai 2024 | ✅ Mesuré |
| 85 | Yi-34B | 01.AI | ▫ n.d. | 14,7 % | 2 novembre 2023 | ✅ Mesuré |
Classement établi sur 85 modèles évalués, dont 74 de grands éditeurs. Score médian de l'ensemble : 49,1 %.
Notre analyse
Un score élevé sur Epoch: GPQA diamond indique qu’un modèle répond correctement à une forte proportion de questions scientifiques avancées. Il traduit donc une performance solide en expertise et en raisonnement sur ce format QCM, sans constituer une mesure générale de toutes les capacités d’une IA. La fiabilité du classement est renforcée par le fait que les scores sont au moins partiellement mesurés par un tiers, plutôt qu’exclusivement auto-déclarés.
Parmi les 137 modèles évalués, la médiane de 66 % et le meilleur score de 95 %, obtenu par OpenAI: GPT-5.4 Pro, montrent un écart substantiel entre le centre du classement et son sommet. Le niveau maximal proche du plafond suggère toutefois un risque de saturation pour les modèles les plus performants, ce qui peut réduire le pouvoir discriminant du benchmark à ce niveau. Sa portée reste circonscrite à 198 questions en anglais, dans certaines disciplines scientifiques et sous forme de QCM. Son accès public impose aussi de considérer le risque de contamination lors de l’interprétation des résultats, sans qu’il invalide à lui seul les scores observés.
Sources des scores : epoch.