SuperGPQA
SuperGPQA est un benchmark conçu par M-A-P, ByteDance Seed et 2077.AI pour évaluer les grands modèles de langage sur des questions académiques de niveau master et doctorat. Il couvre un large éventail de disciplines, notamment des domaines spécialisés rarement représentés dans les…
SuperGPQA est un benchmark conçu par M-A-P, ByteDance Seed et 2077.AI pour évaluer les grands modèles de langage sur des questions académiques de niveau master et doctorat. Il couvre un large éventail de disciplines, notamment des domaines spécialisés rarement représentés dans les évaluations généralistes.
Fondé sur des QCM en anglais, il mesure à la fois la mobilisation de connaissances avancées et le raisonnement nécessaire pour sélectionner une réponse exacte. Sa construction repose sur un filtrage collaboratif entre humains et modèles, avec la participation de plus de 80 experts.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | M-A-P, ByteDance Seed et 2077.AI |
| Capacités mesurées | Connaissances et raisonnement de niveau master/doctorat couvrant 285 disciplines académiques, y compris des domaines de niche |
| Modalité | Texte |
| Type de questions | QCM (choix multiple) de niveau études supérieures |
| Métrique d'évaluation | exactitude (accuracy) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 26 529 questions sur 285 disciplines (13 grands domaines) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (34)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 73,6 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 71,6 % | 31 mars 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 71,4 % | 31 mai 2026 | Auto-déclaré |
| 4 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 70,8 % | 24 juin 2026 | Auto-déclaré |
| 5 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,4 % | 16 février 2026 | Auto-déclaré |
| 6 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 67,4 % | 24 juin 2026 | Auto-déclaré |
| 7 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,1 % | 24 février 2026 | Auto-déclaré |
| 8 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,0 % | 21 avril 2026 | Auto-déclaré |
| 9 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 65,6 % | 24 février 2026 | Auto-déclaré |
| 10 | Qwen3 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 65,1 % | 15 décembre 2025 | Auto-déclaré |
| 11 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,9 % | 25 juillet 2025 | Auto-déclaré |
| 12 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,7 % | 16 avril 2026 | Auto-déclaré |
| 13 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 64,3 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,4 % | 24 février 2026 | Auto-déclaré |
| 15 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,6 % | 22 juillet 2025 | Auto-déclaré |
| 16 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,8 % | 10 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,4 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 59,0 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,8 % | 10 septembre 2025 | Auto-déclaré |
| 20 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 58,2 % | 2 mars 2026 | Auto-déclaré |
| 21 | Kimi K2 Instruct | Moonshot AI | 🟢 Ouvert | 57,2 % | 11 juillet 2025 | Auto-déclaré |
| 22 | Kimi K2-Instruct-0905 | Moonshot AI | 🟢 Ouvert | 57,2 % | 5 septembre 2025 | Auto-déclaré |
| 23 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 56,4 % | 22 septembre 2025 | Auto-déclaré |
| 24 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 54,6 % | 22 septembre 2025 | Auto-déclaré |
| 25 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 53,1 % | 22 septembre 2025 | Auto-déclaré |
| 26 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 52,9 % | 2 mars 2026 | Auto-déclaré |
| 27 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 51,2 % | 22 septembre 2025 | Auto-déclaré |
| 28 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,8 % | 22 septembre 2025 | Auto-déclaré |
| 29 | Kimi K2 Base | Moonshot AI | 🟢 Ouvert | 44,7 % | 11 juillet 2025 | Auto-déclaré |
| 30 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,5 % | 22 septembre 2025 | Auto-déclaré |
| 31 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 44,1 % | 29 avril 2025 | Auto-déclaré |
| 32 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 40,3 % | 22 septembre 2025 | Auto-déclaré |
| 33 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 37,5 % | 2 mars 2026 | Auto-déclaré |
| 34 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 21,3 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 34 modèles évalués. Score médian de l'ensemble : 59,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur SuperGPQA indique une forte capacité à répondre correctement à des questions spécialisées de niveau supérieur, dans des domaines académiques très variés. Il ne mesure toutefois que l’exactitude finale sur des QCM en anglais, et non l’ensemble des aptitudes d’un modèle, comme la production libre ou les usages non académiques. Dans la base, la médiane de 60 % et le meilleur résultat de 74 %, obtenu par Qwen3.7 Max, montrent une hiérarchie nette, tout en laissant une marge de progression importante avant une éventuelle saturation. La comparaison doit rester prudente, car les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés selon un protocole indépendant unique. L’accès public au jeu appelle aussi à surveiller le risque de contamination lors de l’entraînement ou de l’optimisation des modèles. Le classement renseigne donc surtout sur la maîtrise comparative de connaissances et de raisonnements académiques avancés dans le cadre précis de SuperGPQA.
Sources des scores : llm-stats.