MCP-Mark
Créé par EVAL SYS en 2025, MCP-Mark évalue la capacité des modèles de langage à utiliser efficacement des outils reposant sur le Model Context Protocol. Il couvre la découverte des outils, leur sélection, leur invocation et l’interprétation des résultats obtenus.
Créé par EVAL SYS en 2025, MCP-Mark évalue la capacité des modèles de langage à utiliser efficacement des outils reposant sur le Model Context Protocol. Il couvre la découverte des outils, leur sélection, leur invocation et l’interprétation des résultats obtenus.
Le benchmark repose sur des tâches agentiques vérifiées par programme, notamment des opérations CRUD menées avec plusieurs serveurs MCP. Il sert ainsi à comparer l’aptitude des modèles à accomplir des actions concrètes dans des environnements outillés, au-delà de la simple production de texte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | EVAL SYS (eval-sys) |
| Capacités mesurées | Utilisation d'outils Model Context Protocol (MCP) : découverte, sélection, invocation et interprétation des résultats; opérations CRUD à travers divers serveurs MCP |
| Modalité | Texte |
| Type de questions | tâches agentiques / appel d'outils MCP avec vérification programmatique |
| Métrique d'évaluation | pass@1, pass^4 |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 127 tâches (Notion, GitHub, Filesystem, PostgreSQL, Playwright) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.7 Code | Moonshot AI | 🟢 Ouvert | 81,1 % | 12 juin 2026 | Auto-déclaré |
| 2 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 60,8 % | 19 mai 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 58,7 % | 31 mai 2026 | Auto-déclaré |
| 4 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 55,9 % | 20 avril 2026 | Auto-déclaré |
| 5 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 48,2 % | 31 mars 2026 | Auto-déclaré |
| 6 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 46,1 % | 16 février 2026 | Auto-déclaré |
| 7 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 38,0 % | 1 décembre 2025 | Auto-déclaré |
| 8 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 37,0 % | 16 avril 2026 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 52,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur MCP-Mark indique qu’un modèle parvient fréquemment à choisir et employer correctement les outils MCP, puis à exploiter leurs résultats pour mener une tâche à son terme. Les métriques pass@1 et pass^4 rendent compte de cette réussite, tandis que la vérification programmatique apporte un critère mesurable à l’exécution. La fiabilité du classement doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs.
La portée reste circonscrite à 127 tâches en anglais couvrant Notion, GitHub, Filesystem, PostgreSQL et Playwright. Les résultats caractérisent donc ces scénarios MCP plutôt que l’ensemble des usages agentiques. Le caractère public du benchmark peut aussi accroître le risque de contamination. Avec une médiane de 52 % parmi huit modèles et un meilleur résultat de 81 % pour Kimi K2.7 Code, le classement révèle des écarts substantiels et ne paraît pas saturé. La première place traduit une forte maîtrise de ces tâches, sans constituer une mesure générale des capacités d’un modèle.
Sources des scores : llm-stats.