Beyond AIME
Beyond AIME est un benchmark de raisonnement mathématique publié en 2025 par l’équipe Seed de ByteDance. Il rassemble des problèmes originaux de niveau compétition, à réponse courte ou numérique, conçus pour limiter la mémorisation.
Beyond AIME est un benchmark de raisonnement mathématique publié en 2025 par l’équipe Seed de ByteDance. Il rassemble des problèmes originaux de niveau compétition, à réponse courte ou numérique, conçus pour limiter la mémorisation.
Plus exigeant que les jeux de type AIME standard, il sollicite des chaînes de raisonnement plus longues et des décompositions plus difficiles. Son rôle est de distinguer les modèles capables de mener un raisonnement mathématique profond, au-delà de la résolution de formats plus conventionnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | ByteDance (equipe Seed) |
| Capacités mesurées | Evalue le raisonnement mathematique profond avec des chaines de raisonnement plus longues et des decompositions plus difficiles que les jeux de type AIME standard, en limitant la memorisation. |
| Modalité | Texte |
| Type de questions | Problemes mathematiques de competition a reponse courte/numerique (originaux, non triviaux) |
| Métrique d'évaluation | Exactitude (accuracy), generalement moyennee sur plusieurs echantillons |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 100 problemes |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 88,0 % | 24 juin 2026 | Auto-déclaré |
| 2 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 87,0 % | 24 juin 2026 | Auto-déclaré |
| 3 | Sarvam-105B | Sarvam AI | 🟢 Ouvert | 69,1 % | 6 mars 2026 | Auto-déclaré |
| 4 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 66,9 % | 29 avril 2026 | Auto-déclaré |
| 5 | Sarvam-30B | Sarvam AI | 🟢 Ouvert | 58,3 % | 6 mars 2026 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 69,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle produit fréquemment la réponse exacte à des problèmes originaux et non triviaux, malgré la longueur des raisonnements et la difficulté des décompositions. L’exactitude est généralement moyennée sur plusieurs échantillons, ce qui vise une appréciation moins dépendante d’une seule génération. La rigueur d’interprétation reste toutefois limitée par l’origine des résultats, majoritairement auto-déclarés par les éditeurs plutôt que mesurés dans un cadre indépendant. La conception du jeu cherche à réduire la mémorisation, mais son format public impose de rester attentif à la contamination lors de futurs entraînements. Sa portée demeure ciblée sur les mathématiques de compétition en anglais et sur des réponses courtes ou numériques, sans représenter l’ensemble des capacités de raisonnement. Parmi les cinq modèles évalués dans la base, Seed 2.1 Turbo se détache à 88 %, face à une médiane de 69 %. Cet écart révèle une avance nette sur ce benchmark, tandis que le meilleur score, encore inférieur à 100 %, ne signale pas une saturation complète du jeu.
Sources des scores : llm-stats.