Beyond AIME

Beyond AIME est un benchmark de raisonnement mathématique publié en 2025 par l’équipe Seed de ByteDance. Il rassemble des problèmes originaux de niveau compétition, à réponse courte ou numérique, conçus pour limiter la mémorisation.

Beyond AIME est un benchmark de raisonnement mathématique publié en 2025 par l’équipe Seed de ByteDance. Il rassemble des problèmes originaux de niveau compétition, à réponse courte ou numérique, conçus pour limiter la mémorisation.

Plus exigeant que les jeux de type AIME standard, il sollicite des chaînes de raisonnement plus longues et des décompositions plus difficiles. Son rôle est de distinguer les modèles capables de mener un raisonnement mathématique profond, au-delà de la résolution de formats plus conventionnels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkByteDance (equipe Seed)
Capacités mesuréesEvalue le raisonnement mathematique profond avec des chaines de raisonnement plus longues et des decompositions plus difficiles que les jeux de type AIME standard, en limitant la memorisation.
ModalitéTexte
Type de questionsProblemes mathematiques de competition a reponse courte/numerique (originaux, non triviaux)
Métrique d'évaluationExactitude (accuracy), generalement moyennee sur plusieurs echantillons
AccèsPublic
LanguesAnglais
Taille du jeu100 problemes
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Seed 2.1 TurboByteDance🔒 Propriétaire88,0 %24 juin 2026Auto-déclaré
2Seed 2.1 ProByteDance🔒 Propriétaire87,0 %24 juin 2026Auto-déclaré
3Sarvam-105BSarvam AI🟢 Ouvert69,1 %6 mars 2026Auto-déclaré
4Mistral Medium 3.5Mistral AI🟢 Ouvert66,9 %29 avril 2026Auto-déclaré
5Sarvam-30BSarvam AI🟢 Ouvert58,3 %6 mars 2026Auto-déclaré

Classement établi sur 5 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 69,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle produit fréquemment la réponse exacte à des problèmes originaux et non triviaux, malgré la longueur des raisonnements et la difficulté des décompositions. L’exactitude est généralement moyennée sur plusieurs échantillons, ce qui vise une appréciation moins dépendante d’une seule génération. La rigueur d’interprétation reste toutefois limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant. La conception du jeu cherche à réduire la mémorisation, mais son format public impose de rester attentif à la contamination lors de futurs entraînements. Sa portée demeure ciblée sur les mathématiques de compétition en anglais et sur des réponses courtes ou numériques, sans représenter l’ensemble des capacités de raisonnement. Parmi les cinq modèles évalués dans la base, Seed 2.1 Turbo se détache à 88 %, face à une médiane de 69 %. Cet écart révèle une avance nette sur ce benchmark, tandis que le meilleur score, encore inférieur à 100 %, ne signale pas une saturation complète du jeu.


Sources des scores : llm-stats.