MCP Atlas

Créé par Scale AI en 2026, MCP Atlas évalue la capacité des modèles d’IA à utiliser des outils à grande échelle dans des scénarios agentiques complexes. Les tâches imposent un raisonnement en plusieurs étapes et la coordination de plusieurs serveurs et outils réels au moyen du protocole…

Créé par Scale AI en 2026, MCP Atlas évalue la capacité des modèles d’IA à utiliser des outils à grande échelle dans des scénarios agentiques complexes. Les tâches imposent un raisonnement en plusieurs étapes et la coordination de plusieurs serveurs et outils réels au moyen du protocole MCP.

Le benchmark vise ainsi à mesurer non seulement l’exécution correcte d’une tâche, mais aussi l’aptitude d’un agent à mobiliser plusieurs ressources de façon coordonnée. Il fournit un cadre commun pour comparer les modèles sur des usages d’outils proches de workflows opérationnels.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkScale AI
Capacités mesuréesusage d'outils à l'échelle, agents, raisonnement, coordination multi-outils via le protocole MCP
ModalitéTexte
Type de questionstâches agentiques multi-étapes nécessitant la coordination de plusieurs serveurs/outils MCP réels
Métrique d'évaluationtaux de réussite (pass rate) et taux de couverture (coverage rate), jugé par LLM-as-judge (Gemini 2.5 Pro par défaut, seuil 0,75)
AccèsPublic
Languesanglais
Taille du jeu1000 tâches couvrant 36 serveurs MCP et 307 outils distincts
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (30)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Muse Spark 1.1Meta🔒 Propriétaire88,1 %9 juillet 2026Auto-déclaré
2Kimi K3Moonshot AI▫ n.d.84,2 %16 juillet 2026Auto-déclaré
3Seed 2.1 ProByteDance🔒 Propriétaire83,8 %24 juin 2026Auto-déclaré
4Gemini 3.5 FlashGoogle🔒 Propriétaire83,6 %19 mai 2026Auto-déclaré
5Claude Opus 4.8Anthropic🔒 Propriétaire82,2 %28 mai 2026Auto-déclaré
6Seed 2.1 TurboByteDance🔒 Propriétaire80,3 %24 juin 2026Auto-déclaré
7Hy3Tencent🟢 Ouvert79,1 %6 juillet 2026Auto-déclaré
8Claude Opus 4.7Anthropic🔒 Propriétaire77,3 %16 avril 2026Auto-déclaré
9GLM-5.2Zhipu AI🟢 Ouvert76,8 %16 juin 2026Auto-déclaré
10Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire76,4 %19 mai 2026Auto-déclaré
11Kimi K2.7 CodeMoonshot AI🟢 Ouvert76,0 %12 juin 2026Auto-déclaré
12GPT-5.5OpenAI🔒 Propriétaire75,3 %23 avril 2026Auto-déclaré
13MiniMax M3MiniMax🟢 Ouvert74,2 %1 juin 2026Auto-déclaré
14Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire74,1 %31 mars 2026Auto-déclaré
15DeepSeek-V4-Pro-MaxDeepSeek🟢 Ouvert73,6 %23 avril 2026Auto-déclaré
16Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire73,2 %31 mai 2026Auto-déclaré
17GLM-5.1Zhipu AI🟢 Ouvert71,8 %7 avril 2026Auto-déclaré
18Gemini 3.1 Pro PreviewGoogle▫ n.d.69,2 %19 février 2026Auto-déclaré
19DeepSeek-V4-Flash-MaxDeepSeek🟢 Ouvert69,0 %23 avril 2026Auto-déclaré
20GLM-5Zhipu AI🟢 Ouvert67,8 %11 février 2026Auto-déclaré
21GPT-4.5OpenAI🔒 Propriétaire67,2 %5 mars 2026Auto-déclaré
22Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert62,8 %16 avril 2026Auto-déclaré
23Claude Opus 4.6Anthropic🔒 Propriétaire62,7 %5 février 2026Auto-déclaré
24Claude Opus 4.5Anthropic🔒 Propriétaire62,3 %24 novembre 2025Auto-déclaré
25Claude Sonnet 4.6Anthropic🔒 Propriétaire61,3 %17 février 2026Auto-déclaré
26GPT-5.2OpenAI🔒 Propriétaire60,6 %11 décembre 2025Auto-déclaré
27GPT-5.4 miniOpenAI🔒 Propriétaire57,7 %17 mars 2026Auto-déclaré
28Gemini 3 FlashGoogle🔒 Propriétaire57,4 %17 décembre 2025Auto-déclaré
29GPT-5.4 nanoOpenAI🔒 Propriétaire56,1 %17 mars 2026Auto-déclaré
30Nova 2 LiteAmazon🔒 Propriétaire24,6 %2 décembre 2025Auto-déclaré

Classement établi sur 30 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MCP Atlas indique qu’un modèle réussit une large part des tâches agentiques et couvre efficacement les étapes attendues lors de l’utilisation coordonnée de plusieurs outils. L’évaluation combine taux de réussite et taux de couverture, avec Gemini 2.5 Pro comme juge par défaut et un seuil fixé à 0,75. Ce protocole apporte une procédure de jugement commune, mais la fiabilité comparative reste à nuancer puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.

Parmi les 27 modèles recensés, la médiane de 72 % et le meilleur résultat de 84 %, obtenu par Seed 2.1 Pro de ByteDance, montrent une hiérarchie encore différenciée et une marge avant une saturation complète. La portée demeure circonscrite aux tâches en anglais reposant sur MCP, même si leur diversité couvre de nombreux serveurs et outils. L’accès public peut aussi créer un risque de contamination ou d’optimisation ciblée. Le classement reflète donc avant tout la maîtrise de workflows multi-outils MCP, et non une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.