MMMU Créé par Xiang Yue et ses coauteurs en 2023, MMMU, pour Massive Multi-discipline Multimodal Understanding, est un benchmark consacré à l’évaluation de modèles multimodaux sur des contenus de niveau universitaire.
HumanEval Créé par OpenAI en 2021, HumanEval est un benchmark de génération de code qui évalue la capacité d’un modèle à transformer une spécification rédigée en langage naturel en un programme Python fonctionnel.
MATH level 5 Epoch: MATH level 5 est une évaluation issue du benchmark MATH, créé par D. Hendrycks et ses coauteurs en 2021. Elle porte sur le sous-ensemble réunissant les problèmes de difficulté maximale, tirés de mathématiques de compétition et accompagnés de solutions.
LiveCodeBench Créé par Naman Jain et al. en 2024, LiveCodeBench est un benchmark évolutif consacré aux grands modèles de langage spécialisés dans le code. Il collecte en continu des problèmes récents issus de concours de programmation afin de limiter la contamination par les données d’entraînement.
MATH Publié en 2021 par D. Hendrycks et ses coauteurs, MATH est un benchmark consacré à la résolution de problèmes issus de concours de mathématiques. Ses questions ouvertes exigent une réponse courte, accompagnée dans le jeu de données d’une solution détaillée étape par étape.
Humanity's Last Exam Humanity's Last Exam est un benchmark académique multimodal créé en 2025 par le Center for AI Safety (CAIS) et Scale AI. Il confronte les modèles à des questions expertes en mathématiques, sciences naturelles et sciences humaines, avec des solutions conçues pour être vérifiables et sans…
OTIS Mock AIME 2024-2025 Epoch: OTIS Mock AIME 2024-2025 est un benchmark créé par Epoch AI pour évaluer la résolution de problèmes mathématiques de niveau compétition, dans un registre intermédiaire à avancé. Il rassemble des exercices inspirés du format AIME, avec des réponses entières comprises entre 0 et 999.