MathArena Apex

MathArena Apex est un benchmark de mathématiques conçu en 2025 par SRI Lab, à l’ETH Zurich, et INSAIT. Il rassemble des problèmes particulièrement difficiles de niveau olympiade, formulés en anglais et demandant une réponse finale.

MathArena Apex est un benchmark de mathématiques conçu en 2025 par SRI Lab, à l’ETH Zurich, et INSAIT. Il rassemble des problèmes particulièrement difficiles de niveau olympiade, formulés en anglais et demandant une réponse finale.

Son objectif est d’évaluer le raisonnement mathématique avancé et la résolution de problèmes complexes en plusieurs étapes. Il sert ainsi à distinguer les modèles capables de mener un raisonnement approfondi sur des exercices situés au sommet des compétitions mathématiques.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkSRI Lab (ETH Zurich) et INSAIT
Capacités mesuréesRaisonnement mathematique avance de niveau olympiade sur les problemes les plus difficiles, multi-etapes.
ModalitéTexte
Type de questionsProblemes mathematiques a reponse finale (niveau olympiade)
Métrique d'évaluationpass@k (pass@16 pour Apex)
AccèsPublic
LanguesAnglais
Taille du jeu12 problemes (6 a reponse finale + 6 adaptes de competitions a preuve)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert90,2 %23 avril 2026Auto-déclaré
2DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert85,7 %23 avril 2026Auto-déclaré
3Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire44,5 %19 mai 2026Auto-déclaré
4Hy3Tencent🟢 Ouvert38,7 %6 juillet 2026Auto-déclaré
5Seed 2.1 TurboByteDance🔒 Propriétaire35,4 %24 juin 2026Auto-déclaré
6Seed 2.1 ProByteDance🔒 Propriétaire31,3 %24 juin 2026Auto-déclaré
7Gemini 3 ProGoogle🔒 Propriétaire23,4 %18 novembre 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 38,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé en pass@16 signifie qu’un modèle parvient fréquemment à produire au moins une réponse correcte parmi seize tentatives. Cette métrique valorise donc la capacité à résoudre les problèmes, mais aussi l’intérêt de multiplier les générations. Avec seulement douze problèmes, chaque réussite pèse fortement sur le résultat, ce qui limite la portée statistique du classement. La composition mêlant réponses finales et adaptations de compétitions à preuve couvre plusieurs formes de difficulté, tout en restant centrée sur les mathématiques de niveau olympiade.

Le meilleur score, 90 %, est nettement supérieur à la médiane de 40 % observée parmi les six modèles de la base. Cet écart révèle une forte différenciation sur cet ensemble, tandis qu’un résultat proche du plafond peut réduire la capacité à départager les meilleurs systèmes et signaler un risque de saturation. L’accès public facilite l’évaluation, mais expose aussi le benchmark au risque de contamination. Enfin, les scores étant majoritairement auto-déclarés par les éditeurs, leur comparaison offre une rigueur moindre qu’une mesure entièrement indépendante et uniforme.


Sources des scores : llm-stats.