AMC_2022_23
AMC_2022_23 est un benchmark issu des épreuves officielles de l’American Mathematics Competition de l’année scolaire 2022-2023, organisées par la Mathematical Association of America. Il rassemble des problèmes de mathématiques à choix multiple destinés au niveau lycée.
AMC_2022_23 est un benchmark issu des épreuves officielles de l’American Mathematics Competition de l’année scolaire 2022-2023, organisées par la Mathematical Association of America. Il rassemble des problèmes de mathématiques à choix multiple destinés au niveau lycée.
Il évalue la capacité des modèles à mobiliser des connaissances en algèbre, géométrie, théorie des nombres et combinatoire, ainsi qu’à élaborer des stratégies face à des problèmes non routiniers. Dans une modelothèque, il sert à comparer leur raisonnement mathématique sur un corpus de compétition homogène.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mathematical Association of America (MAA) |
| Capacités mesurées | mathématiques, raisonnement |
| Modalité | Texte |
| Type de questions | QCM |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | propriétaire |
| Langues | anglais |
| Taille du jeu | environ 100 questions |
| Année de publication | 2023 |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (6)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Mistral Large 3 (675B Base) | Mistral AI | 🟢 Ouvert | 52,0 % | 4 décembre 2025 | Auto-déclaré |
| 2 | Mistral Large 3 (675B Instruct 2512 Eagle) | Mistral AI | 🟢 Ouvert | 52,0 % | 4 décembre 2025 | Auto-déclaré |
| 3 | Mistral Large 3 (675B Instruct 2512 NVFP4) | Mistral AI | 🟢 Ouvert | 52,0 % | 4 décembre 2025 | Auto-déclaré |
| 4 | Mistral Large 3 (675B Instruct 2512) | Mistral AI | 🟢 Ouvert | 52,0 % | 4 décembre 2025 | Auto-déclaré |
| 5 | Gemini 1.5 Pro | 🔒 Propriétaire | 46,4 % | 1 mai 2024 | Auto-déclaré | |
| 6 | Gemini 1.5 Flash | 🔒 Propriétaire | 34,8 % | 1 mai 2024 | Auto-déclaré |
Classement établi sur 6 modèles évalués, dont 6 de grands éditeurs. Score médian de l'ensemble : 52,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur AMC_2022_23 indique qu’un modèle répond correctement à une forte proportion de problèmes de compétition, ce qui reflète sa maîtrise des domaines couverts et son aptitude à construire des raisonnements adaptés à des exercices non routiniers. L’accuracy fournit une mesure directe, mais la fiabilité comparative reste à nuancer puisque les résultats recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés dans un protocole unique.
Le meilleur résultat observé, obtenu par Mistral Large 3 (675B Base), est identique au score médian de 52 %. Sur les six modèles évalués, ce rapprochement ne fait donc pas apparaître d’écart entre la valeur centrale et la tête du classement. Le niveau atteint ne signale pas de saturation du benchmark. L’interprétation doit néanmoins tenir compte de sa portée ciblée : environ 100 QCM en anglais, centrés sur les mathématiques de compétition de niveau lycée. Enfin, l’accès public à des problèmes issus d’épreuves officielles crée un risque de contamination des données d’entraînement, susceptible d’influencer les scores sans refléter uniquement une capacité de généralisation.
Sources des scores : llm-stats.