ARC-AGI ARC-AGI est un benchmark de raisonnement abstrait créé par François Chollet en 2019. Il repose sur des tâches visuelles dans lesquelles quelques paires de grilles illustrent une transformation gouvernée par une règle implicite.
AutomationBench AutomationBench est un benchmark consacré à l’usage d’outils par des agents d’intelligence artificielle. Il évalue leur capacité à automatiser des workflows réels, en orchestrant plusieurs outils pour mener à bien des tâches composées de plusieurs étapes.
MMBench MMBench est un benchmark bilingue créé en 2023 par Shanghai AI Laboratory et OpenCompass, dans le cadre des travaux de Y. Liu et al. Il évalue les capacités multimodales des modèles de vision et de langage au moyen de questions à choix multiples en anglais et en chinois.
CyberGym CyberGym est un benchmark de cybersécurité créé en 2025 par une équipe de l’UC Berkeley menée par Dawn Song. Il évalue des agents IA dans un environnement contrôlé, à travers des tâches fondées sur des vulnérabilités logicielles réelles.
OmniDocBench 1.5 OmniDocBench 1.5 est un benchmark créé par OpenDataLab pour évaluer la compréhension et le parsing de documents par les grands modèles multimodaux. Il couvre notamment l’OCR, l’extraction d’information, l’analyse de la mise en page, les tables, les formules et la réponse à des questions…
BrowseComp-zh BrowseComp-zh est un benchmark à haute difficulté conçu par les auteurs de BrowseComp-ZH, Peilin Zhou et al., pour évaluer les agents fondés sur des LLM dans l’environnement du web chinois.
CharXiv-D CharXiv-D est le sous-ensemble descriptif de CharXiv, un benchmark publié en 2024 par Princeton Language and Intelligence, UW-Madison et l’University of Hong Kong. Il repose sur des graphiques scientifiques réels et diversifiés provenant d’articles arXiv, avec des questions élaborées et…