APEX-Agents
Créé par Mercor, APEX-Agents est un benchmark consacré aux agents d’intelligence artificielle confrontés à des tâches professionnelles complexes et de longue durée. Il évalue leur capacité à conduire de façon autonome des workflows en plusieurs étapes, mobilisant plusieurs applications.
Créé par Mercor, APEX-Agents est un benchmark consacré aux agents d’intelligence artificielle confrontés à des tâches professionnelles complexes et de longue durée. Il évalue leur capacité à conduire de façon autonome des workflows en plusieurs étapes, mobilisant plusieurs applications.
Les épreuves sollicitent un raisonnement soutenu, la planification et l’orchestration d’outils dans trois métiers hautement qualifiés. APEX-Agents sert ainsi à comparer les modèles sur leur aptitude à exécuter un travail agentique complet, plutôt qu’à produire une réponse isolée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Mercor |
| Capacités mesurées | Mesure si des agents IA peuvent executer de maniere autonome des taches de travail de la connaissance hautement qualifie, exigeant raisonnement soutenu, planification et orchestration d'outils sur de longs horizons. |
| Modalité | Texte |
| Type de questions | Taches agentiques professionnelles long-horizon, multi-applications, evaluees par rubrique a criteres binaires |
| Métrique d'évaluation | Notation par rubrique (criteres binaires, moyenne ~4 criteres par tache) ; Pass@1 |
| Accès | Public |
| Licence | CC-BY 4.0 |
| Langues | Anglais |
| Taille du jeu | 480 taches reparties sur 33 mondes (160 par metier : banque d'investissement, conseil en management, droit des affaires) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (7)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K3 | Moonshot AI | ▫ n.d. | 37,6 % | 16 juillet 2026 | Auto-déclaré |
| 2 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 33,8 % | 24 juin 2026 | Auto-déclaré |
| 3 | Gemini 3.1 Pro Preview | ▫ n.d. | 33,5 % | 19 février 2026 | Auto-déclaré | |
| 4 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 29,2 % | 24 juin 2026 | Auto-déclaré |
| 5 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 27,9 % | 20 avril 2026 | Auto-déclaré |
| 6 | MiniMax M3 | MiniMax | 🟢 Ouvert | 27,7 % | 1 juin 2026 | Auto-déclaré |
| 7 | Hy3 | Tencent | 🟢 Ouvert | 25,6 % | 6 juillet 2026 | Auto-déclaré |
Classement établi sur 7 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 29,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent satisfait davantage de critères binaires associés à chaque tâche dès sa première tentative. Il traduit donc une meilleure capacité à maintenir un raisonnement, organiser des étapes et utiliser des outils sur de longs horizons. La notation par rubrique apporte une structure explicite à l’évaluation, mais la fiabilité comparative reste à nuancer puisque les résultats recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que mesurés selon une procédure indépendante unique.
Avec une médiane de 29 % parmi les cinq modèles évalués et un meilleur résultat de 34 % pour Seed 2.1 Pro, le classement montre que les performances demeurent limitées et proches les unes des autres. Ces niveaux ne suggèrent pas une saturation du benchmark. Sa portée reste circonscrite aux tâches anglophones de banque d’investissement, de conseil en management et de droit des affaires. Enfin, son accès public favorise la reproductibilité, mais implique aussi de considérer le risque d’exposition préalable des modèles aux tâches lors de l’interprétation des scores.
Sources des scores : llm-stats.