APEX-Agents

Créé par Mercor, APEX-Agents est un benchmark consacré aux agents d’intelligence artificielle confrontés à des tâches professionnelles complexes et de longue durée. Il évalue leur capacité à conduire de façon autonome des workflows en plusieurs étapes, mobilisant plusieurs applications.

Créé par Mercor, APEX-Agents est un benchmark consacré aux agents d’intelligence artificielle confrontés à des tâches professionnelles complexes et de longue durée. Il évalue leur capacité à conduire de façon autonome des workflows en plusieurs étapes, mobilisant plusieurs applications.

Les épreuves sollicitent un raisonnement soutenu, la planification et l’orchestration d’outils dans trois métiers hautement qualifiés. APEX-Agents sert ainsi à comparer les modèles sur leur aptitude à exécuter un travail agentique complet, plutôt qu’à produire une réponse isolée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkMercor
Capacités mesuréesMesure si des agents IA peuvent executer de maniere autonome des taches de travail de la connaissance hautement qualifie, exigeant raisonnement soutenu, planification et orchestration d'outils sur de longs horizons.
ModalitéTexte
Type de questionsTaches agentiques professionnelles long-horizon, multi-applications, evaluees par rubrique a criteres binaires
Métrique d'évaluationNotation par rubrique (criteres binaires, moyenne ~4 criteres par tache) ; Pass@1
AccèsPublic
LicenceCC-BY 4.0
LanguesAnglais
Taille du jeu480 taches reparties sur 33 mondes (160 par metier : banque d'investissement, conseil en management, droit des affaires)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K3Moonshot AI▫ n.d.37,6 %16 juillet 2026Auto-déclaré
2Seed 2.1 ProByteDance🔒 Propriétaire33,8 %24 juin 2026Auto-déclaré
3Gemini 3.1 Pro PreviewGoogle▫ n.d.33,5 %19 février 2026Auto-déclaré
4Seed 2.1 TurboByteDance🔒 Propriétaire29,2 %24 juin 2026Auto-déclaré
5Kimi K2.6Moonshot AI🟢 Ouvert27,9 %20 avril 2026Auto-déclaré
6MiniMax M3MiniMax🟢 Ouvert27,7 %1 juin 2026Auto-déclaré
7Hy3Tencent🟢 Ouvert25,6 %6 juillet 2026Auto-déclaré

Classement établi sur 7 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 29,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent satisfait davantage de critères binaires associés à chaque tâche dès sa première tentative. Il traduit donc une meilleure capacité à maintenir un raisonnement, organiser des étapes et utiliser des outils sur de longs horizons. La notation par rubrique apporte une structure explicite à l’évaluation, mais la fiabilité comparative reste à nuancer puisque les résultats recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon une procédure indépendante unique.

Avec une médiane de 29 % parmi les cinq modèles évalués et un meilleur résultat de 34 % pour Seed 2.1 Pro, le classement montre que les performances demeurent limitées et proches les unes des autres. Ces niveaux ne suggèrent pas une saturation du benchmark. Sa portée reste circonscrite aux tâches anglophones de banque d’investissement, de conseil en management et de droit des affaires. Enfin, son accès public favorise la reproductibilité, mais implique aussi de considérer le risque d’exposition préalable des modèles aux tâches lors de l’interprétation des scores.


Sources des scores : llm-stats.