MCP-Mark

Créé par EVAL SYS en 2025, MCP-Mark évalue la capacité des modèles de langage à utiliser efficacement des outils reposant sur le Model Context Protocol. Il couvre la découverte des outils, leur sélection, leur invocation et l’interprétation des résultats obtenus.

Créé par EVAL SYS en 2025, MCP-Mark évalue la capacité des modèles de langage à utiliser efficacement des outils reposant sur le Model Context Protocol. Il couvre la découverte des outils, leur sélection, leur invocation et l’interprétation des résultats obtenus.

Le benchmark repose sur des tâches agentiques vérifiées par programme, notamment des opérations CRUD menées avec plusieurs serveurs MCP. Il sert ainsi à comparer l’aptitude des modèles à accomplir des actions concrètes dans des environnements outillés, au-delà de la simple production de texte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkEVAL SYS (eval-sys)
Capacités mesuréesUtilisation d'outils Model Context Protocol (MCP) : découverte, sélection, invocation et interprétation des résultats; opérations CRUD à travers divers serveurs MCP
ModalitéTexte
Type de questionstâches agentiques / appel d'outils MCP avec vérification programmatique
Métrique d'évaluationpass@1, pass^4
AccèsPublic
Languesanglais
Taille du jeu127 tâches (Notion, GitHub, Filesystem, PostgreSQL, Playwright)
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.7 CodeMoonshot AI🟢 Ouvert81,1 %12 juin 2026Auto-déclaré
2Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire60,8 %19 mai 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire58,7 %31 mai 2026Auto-déclaré
4Kimi K2.6Moonshot AI🟢 Ouvert55,9 %20 avril 2026Auto-déclaré
5Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire48,2 %31 mars 2026Auto-déclaré
6Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert46,1 %16 février 2026Auto-déclaré
7DeepSeek-V3.2DeepSeek🟢 Ouvert38,0 %1 décembre 2025Auto-déclaré
8Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert37,0 %16 avril 2026Auto-déclaré

Classement établi sur 8 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 52,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur MCP-Mark indique qu’un modèle parvient fréquemment à choisir et employer correctement les outils MCP, puis à exploiter leurs résultats pour mener une tâche à son terme. Les métriques pass@1 et pass^4 rendent compte de cette réussite, tandis que la vérification programmatique apporte un critère mesurable à l’exécution. La fiabilité du classement doit toutefois être nuancée, car les scores sont majoritairement auto-déclarés par les éditeurs.

La portée reste circonscrite à 127 tâches en anglais couvrant Notion, GitHub, Filesystem, PostgreSQL et Playwright. Les résultats caractérisent donc ces scénarios MCP plutôt que l’ensemble des usages agentiques. Le caractère public du benchmark peut aussi accroître le risque de contamination. Avec une médiane de 52 % parmi huit modèles et un meilleur résultat de 81 % pour Kimi K2.7 Code, le classement révèle des écarts substantiels et ne paraît pas saturé. La première place traduit une forte maîtrise de ces tâches, sans constituer une mesure générale des capacités d’un modèle.


Sources des scores : llm-stats.