SuperGPQA

SuperGPQA est un benchmark conçu par M-A-P, ByteDance Seed et 2077.AI pour évaluer les grands modèles de langage sur des questions académiques de niveau master et doctorat. Il couvre un large éventail de disciplines, notamment des domaines spécialisés rarement représentés dans les…

SuperGPQA est un benchmark conçu par M-A-P, ByteDance Seed et 2077.AI pour évaluer les grands modèles de langage sur des questions académiques de niveau master et doctorat. Il couvre un large éventail de disciplines, notamment des domaines spécialisés rarement représentés dans les évaluations généralistes.

Fondé sur des QCM en anglais, il mesure à la fois la mobilisation de connaissances avancées et le raisonnement nécessaire pour sélectionner une réponse exacte. Sa construction repose sur un filtrage collaboratif entre humains et modèles, avec la participation de plus de 80 experts.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkM-A-P, ByteDance Seed et 2077.AI
Capacités mesuréesConnaissances et raisonnement de niveau master/doctorat couvrant 285 disciplines académiques, y compris des domaines de niche
ModalitéTexte
Type de questionsQCM (choix multiple) de niveau études supérieures
Métrique d'évaluationexactitude (accuracy)
AccèsPublic
Languesanglais
Taille du jeu26 529 questions sur 285 disciplines (13 grands domaines)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (34)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire73,6 %19 mai 2026Auto-déclaré
2Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire71,6 %31 mars 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire71,4 %31 mai 2026Auto-déclaré
4Seed 2.1 ProByteDance🔒 Propriétaire70,8 %24 juin 2026Auto-déclaré
5Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert70,4 %16 février 2026Auto-déclaré
6Seed 2.1 TurboByteDance🔒 Propriétaire67,4 %24 juin 2026Auto-déclaré
7Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert67,1 %24 février 2026Auto-déclaré
8Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert66,0 %21 avril 2026Auto-déclaré
9Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert65,6 %24 février 2026Auto-déclaré
10Qwen3 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire65,1 %15 décembre 2025Auto-déclaré
11Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert64,9 %25 juillet 2025Auto-déclaré
12Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert64,7 %16 avril 2026Auto-déclaré
13Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert64,3 %22 septembre 2025Auto-déclaré
14Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert63,4 %24 février 2026Auto-déclaré
15Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert62,6 %22 juillet 2025Auto-déclaré
16Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert60,8 %10 septembre 2025Auto-déclaré
17Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert60,4 %22 septembre 2025Auto-déclaré
18Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert59,0 %22 septembre 2025Auto-déclaré
19Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert58,8 %10 septembre 2025Auto-déclaré
20Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert58,2 %2 mars 2026Auto-déclaré
21Kimi K2 InstructMoonshot AI🟢 Ouvert57,2 %11 juillet 2025Auto-déclaré
22Kimi K2-Instruct-0905Moonshot AI🟢 Ouvert57,2 %5 septembre 2025Auto-déclaré
23Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert56,4 %22 septembre 2025Auto-déclaré
24Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert54,6 %22 septembre 2025Auto-déclaré
25Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert53,1 %22 septembre 2025Auto-déclaré
26Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert52,9 %2 mars 2026Auto-déclaré
27Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert51,2 %22 septembre 2025Auto-déclaré
28Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert46,8 %22 septembre 2025Auto-déclaré
29Kimi K2 BaseMoonshot AI🟢 Ouvert44,7 %11 juillet 2025Auto-déclaré
30Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert44,5 %22 septembre 2025Auto-déclaré
31Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert44,1 %29 avril 2025Auto-déclaré
32Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert40,3 %22 septembre 2025Auto-déclaré
33Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert37,5 %2 mars 2026Auto-déclaré
34Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert21,3 %2 mars 2026Auto-déclaré

Classement établi sur 34 modèles évalués. Score médian de l'ensemble : 59,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur SuperGPQA indique une forte capacité à répondre correctement à des questions spécialisées de niveau supérieur, dans des domaines académiques très variés. Il ne mesure toutefois que l’exactitude finale sur des QCM en anglais, et non l’ensemble des aptitudes d’un modèle, comme la production libre ou les usages non académiques. Dans la base, la médiane de 60 % et le meilleur résultat de 74 %, obtenu par Qwen3.7 Max, montrent une hiérarchie nette, tout en laissant une marge de progression importante avant une éventuelle saturation. La comparaison doit rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public au jeu appelle aussi à surveiller le risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Le classement renseigne donc surtout sur la maîtrise comparative de connaissances et de raisonnements académiques avancés dans le cadre précis de SuperGPQA.


Sources des scores : llm-stats.