MathArena Apex
MathArena Apex est un benchmark de mathématiques conçu en 2025 par SRI Lab, à l’ETH Zurich, et INSAIT. Il rassemble des problèmes particulièrement difficiles de niveau olympiade, formulés en anglais et demandant une réponse finale.
MathArena Apex est un benchmark de mathématiques conçu en 2025 par SRI Lab, à l’ETH Zurich, et INSAIT. Il rassemble des problèmes particulièrement difficiles de niveau olympiade, formulés en anglais et demandant une réponse finale.
Son objectif est d’évaluer le raisonnement mathématique avancé et la résolution de problèmes complexes en plusieurs étapes. Il sert ainsi à distinguer les modèles capables de mener un raisonnement approfondi sur des exercices situés au sommet des compétitions mathématiques.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | SRI Lab (ETH Zurich) et INSAIT |
| Capacités mesurées | Raisonnement mathematique avance de niveau olympiade sur les problemes les plus difficiles, multi-etapes. |
| Modalité | Texte |
| Type de questions | Problemes mathematiques a reponse finale (niveau olympiade) |
| Métrique d'évaluation | pass@k (pass@16 pour Apex) |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 12 problemes (6 a reponse finale + 6 adaptes de competitions a preuve) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 90,2 % | 23 avril 2026 | Auto-déclaré |
| 2 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 85,7 % | 23 avril 2026 | Auto-déclaré |
| 3 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 44,5 % | 19 mai 2026 | Auto-déclaré |
| 4 | Hy3 | Tencent | 🟢 Ouvert | 38,7 % | 6 juillet 2026 | Auto-déclaré |
| 5 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 35,4 % | 24 juin 2026 | Auto-déclaré |
| 6 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 31,3 % | 24 juin 2026 | Auto-déclaré |
| 7 | Gemini 3 Pro | 🔒 Propriétaire | 23,4 % | 18 novembre 2025 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 38,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé en pass@16 signifie qu’un modèle parvient fréquemment à produire au moins une réponse correcte parmi seize tentatives. Cette métrique valorise donc la capacité à résoudre les problèmes, mais aussi l’intérêt de multiplier les générations. Avec seulement douze problèmes, chaque réussite pèse fortement sur le résultat, ce qui limite la portée statistique du classement. La composition mêlant réponses finales et adaptations de compétitions à preuve couvre plusieurs formes de difficulté, tout en restant centrée sur les mathématiques de niveau olympiade.
Le meilleur score, 90 %, est nettement supérieur à la médiane de 40 % observée parmi les six modèles de la base. Cet écart révèle une forte différenciation sur cet ensemble, tandis qu’un résultat proche du plafond peut réduire la capacité à départager les meilleurs systèmes et signaler un risque de saturation. L’accès public facilite l’évaluation, mais expose aussi le benchmark au risque de contamination. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison offre une rigueur moindre qu’une mesure entièrement indépendante et uniforme.
Sources des scores : llm-stats.