Claw-Eval

Claw-Eval est un benchmark conçu par Bowen Ye et ses coauteurs de l’Université de Pékin et de l’Université de Hong Kong pour évaluer des agents autonomes dans des scénarios réalistes, complexes et composés de plusieurs étapes.

Claw-Eval est un benchmark conçu par Bowen Ye et ses coauteurs de l’Université de Pékin et de l’Université de Hong Kong pour évaluer des agents autonomes dans des scénarios réalistes, complexes et composés de plusieurs étapes.

Il examine conjointement la complétion des tâches, la sécurité et la robustesse. Sa notation auditable s’appuie sur la trajectoire d’exécution, notamment l’usage des outils et la navigation dans les environnements, afin d’évaluer la capacité d’un modèle à mener une tâche agentique de bout en bout sans intervention.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBowen Ye et al. (Université de Pékin & Université de Hong Kong)
Capacités mesuréesÉvalue les agents autonomes selon trois axes (complétion, sécurité, robustesse) via une notation auditable basée sur la trajectoire d'exécution.
ModalitéTexte
Type de questionstâches agentiques end-to-end multi-étapes (9 catégories)
Métrique d'évaluationAverage Score, Pass@k et Pass^k (sur 3 essais), notation par trajectoire
AccèsPublic
LicenceMIT
Languesanglais
Taille du jeu300 tâches vérifiées par humains (2 159 items de rubrique)
Année de publication2026
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Kimi K2.6Moonshot AI🟢 Ouvert80,9 %20 avril 2026Auto-déclaré
2GLM-5V-TurboZhipu AI🔒 Propriétaire75,0 %2 avril 2026Auto-déclaré
3MiniMax M3MiniMax🟢 Ouvert74,5 %1 juin 2026Auto-déclaré
4Hy3Tencent🟢 Ouvert68,5 %6 juillet 2026Auto-déclaré
5Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire65,2 %19 mai 2026Auto-déclaré
6MiMo-V2.5-ProXiaomi🟢 Ouvert64,0 %27 avril 2026Auto-déclaré
7MiMo-V2.5Xiaomi🟢 Ouvert63,2 %22 avril 2026Auto-déclaré
8Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire62,7 %31 mai 2026Auto-déclaré
9MiMo-V2-ProXiaomi🔒 Propriétaire61,5 %18 mars 2026Auto-déclaré
10Qwen3.6-27BAlibaba Cloud / Qwen Team🟢 Ouvert60,6 %21 avril 2026Auto-déclaré
11Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire58,7 %31 mars 2026Auto-déclaré
12MiMo-V2-OmniXiaomi🔒 Propriétaire54,8 %18 mars 2026Auto-déclaré
13Qwen3.6-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert50,0 %16 avril 2026Auto-déclaré

Classement établi sur 13 modèles évalués. Score médian de l'ensemble : 63,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé dans Claw-Eval traduit une aptitude à achever des tâches multi-étapes tout en respectant les critères de sécurité et de robustesse inscrits dans les rubriques. La notation par trajectoire apporte une granularité utile, car elle évalue le déroulement de l’exécution plutôt que le seul résultat final. Pass@k et Pass^k, calculés sur trois essais, rendent également compte de la réussite et de sa répétabilité.

Cette rigueur méthodologique doit être distinguée de la provenance des résultats publiés dans la base, majoritairement auto-déclarés par les éditeurs. Leur comparaison repose donc largement sur les mesures communiquées par les acteurs évalués, même si le protocole est auditable. Avec une médiane de 63 % et un meilleur résultat de 81 % pour Kimi K2.6, le classement montre une différenciation nette entre les douze modèles et ne paraît pas saturé au sommet. Sa portée reste celle de 300 tâches en anglais, réparties entre neuf catégories. Ces résultats caractérisent donc avant tout les performances sur ce cadre agentique précis, fondé sur 2 159 items de rubrique.


Sources des scores : llm-stats.