MCP Atlas
Créé par Scale AI en 2026, MCP Atlas évalue la capacité des modèles d’IA à utiliser des outils à grande échelle dans des scénarios agentiques complexes. Les tâches imposent un raisonnement en plusieurs étapes et la coordination de plusieurs serveurs et outils réels au moyen du protocole…
Créé par Scale AI en 2026, MCP Atlas évalue la capacité des modèles d’IA à utiliser des outils à grande échelle dans des scénarios agentiques complexes. Les tâches imposent un raisonnement en plusieurs étapes et la coordination de plusieurs serveurs et outils réels au moyen du protocole MCP.
Le benchmark vise ainsi à mesurer non seulement l’exécution correcte d’une tâche, mais aussi l’aptitude d’un agent à mobiliser plusieurs ressources de façon coordonnée. Il fournit un cadre commun pour comparer les modèles sur des usages d’outils proches de workflows opérationnels.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Scale AI |
| Capacités mesurées | usage d'outils à l'échelle, agents, raisonnement, coordination multi-outils via le protocole MCP |
| Modalité | Texte |
| Type de questions | tâches agentiques multi-étapes nécessitant la coordination de plusieurs serveurs/outils MCP réels |
| Métrique d'évaluation | taux de réussite (pass rate) et taux de couverture (coverage rate), jugé par LLM-as-judge (Gemini 2.5 Pro par défaut, seuil 0,75) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 1000 tâches couvrant 36 serveurs MCP et 307 outils distincts |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (30)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 88,1 % | 9 juillet 2026 | Auto-déclaré |
| 2 | Kimi K3 | Moonshot AI | ▫ n.d. | 84,2 % | 16 juillet 2026 | Auto-déclaré |
| 3 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 83,8 % | 24 juin 2026 | Auto-déclaré |
| 4 | Gemini 3.5 Flash | 🔒 Propriétaire | 83,6 % | 19 mai 2026 | Auto-déclaré | |
| 5 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 82,2 % | 28 mai 2026 | Auto-déclaré |
| 6 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 80,3 % | 24 juin 2026 | Auto-déclaré |
| 7 | Hy3 | Tencent | 🟢 Ouvert | 79,1 % | 6 juillet 2026 | Auto-déclaré |
| 8 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 77,3 % | 16 avril 2026 | Auto-déclaré |
| 9 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 76,8 % | 16 juin 2026 | Auto-déclaré |
| 10 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 76,4 % | 19 mai 2026 | Auto-déclaré |
| 11 | Kimi K2.7 Code | Moonshot AI | 🟢 Ouvert | 76,0 % | 12 juin 2026 | Auto-déclaré |
| 12 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 75,3 % | 23 avril 2026 | Auto-déclaré |
| 13 | MiniMax M3 | MiniMax | 🟢 Ouvert | 74,2 % | 1 juin 2026 | Auto-déclaré |
| 14 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 74,1 % | 31 mars 2026 | Auto-déclaré |
| 15 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 73,6 % | 23 avril 2026 | Auto-déclaré |
| 16 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 73,2 % | 31 mai 2026 | Auto-déclaré |
| 17 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 71,8 % | 7 avril 2026 | Auto-déclaré |
| 18 | Gemini 3.1 Pro Preview | ▫ n.d. | 69,2 % | 19 février 2026 | Auto-déclaré | |
| 19 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 69,0 % | 23 avril 2026 | Auto-déclaré |
| 20 | GLM-5 | Zhipu AI | 🟢 Ouvert | 67,8 % | 11 février 2026 | Auto-déclaré |
| 21 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 67,2 % | 5 mars 2026 | Auto-déclaré |
| 22 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 62,8 % | 16 avril 2026 | Auto-déclaré |
| 23 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 62,7 % | 5 février 2026 | Auto-déclaré |
| 24 | Claude Opus 4.5 | Anthropic | 🔒 Propriétaire | 62,3 % | 24 novembre 2025 | Auto-déclaré |
| 25 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 61,3 % | 17 février 2026 | Auto-déclaré |
| 26 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 60,6 % | 11 décembre 2025 | Auto-déclaré |
| 27 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 57,7 % | 17 mars 2026 | Auto-déclaré |
| 28 | Gemini 3 Flash | 🔒 Propriétaire | 57,4 % | 17 décembre 2025 | Auto-déclaré | |
| 29 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 56,1 % | 17 mars 2026 | Auto-déclaré |
| 30 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 24,6 % | 2 décembre 2025 | Auto-déclaré |
Classement établi sur 30 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 73,4 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MCP Atlas indique qu’un modèle réussit une large part des tâches agentiques et couvre efficacement les étapes attendues lors de l’utilisation coordonnée de plusieurs outils. L’évaluation combine taux de réussite et taux de couverture, avec Gemini 2.5 Pro comme juge par défaut et un seuil fixé à 0,75. Ce protocole apporte une procédure de jugement commune, mais la fiabilité comparative reste à nuancer puisque les scores sont majoritairement auto-déclarés par les éditeurs plutôt que mesurés de manière indépendante.
Parmi les 27 modèles recensés, la médiane de 72 % et le meilleur résultat de 84 %, obtenu par Seed 2.1 Pro de ByteDance, montrent une hiérarchie encore différenciée et une marge avant une saturation complète. La portée demeure circonscrite aux tâches en anglais reposant sur MCP, même si leur diversité couvre de nombreux serveurs et outils. L’accès public peut aussi créer un risque de contamination ou d’optimisation ciblée. Le classement reflète donc avant tout la maîtrise de workflows multi-outils MCP, et non une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.