Claw-Eval
Claw-Eval est un benchmark conçu par Bowen Ye et ses coauteurs de l’Université de Pékin et de l’Université de Hong Kong pour évaluer des agents autonomes dans des scénarios réalistes, complexes et composés de plusieurs étapes.
Claw-Eval est un benchmark conçu par Bowen Ye et ses coauteurs de l’Université de Pékin et de l’Université de Hong Kong pour évaluer des agents autonomes dans des scénarios réalistes, complexes et composés de plusieurs étapes.
Il examine conjointement la complétion des tâches, la sécurité et la robustesse. Sa notation auditable s’appuie sur la trajectoire d’exécution, notamment l’usage des outils et la navigation dans les environnements, afin d’évaluer la capacité d’un modèle à mener une tâche agentique de bout en bout sans intervention.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Bowen Ye et al. (Université de Pékin & Université de Hong Kong) |
| Capacités mesurées | Évalue les agents autonomes selon trois axes (complétion, sécurité, robustesse) via une notation auditable basée sur la trajectoire d'exécution. |
| Modalité | Texte |
| Type de questions | tâches agentiques end-to-end multi-étapes (9 catégories) |
| Métrique d'évaluation | Average Score, Pass@k et Pass^k (sur 3 essais), notation par trajectoire |
| Accès | Public |
| Licence | MIT |
| Langues | anglais |
| Taille du jeu | 300 tâches vérifiées par humains (2 159 items de rubrique) |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 80,9 % | 20 avril 2026 | Auto-déclaré |
| 2 | GLM-5V-Turbo | Zhipu AI | 🔒 Propriétaire | 75,0 % | 2 avril 2026 | Auto-déclaré |
| 3 | MiniMax M3 | MiniMax | 🟢 Ouvert | 74,5 % | 1 juin 2026 | Auto-déclaré |
| 4 | Hy3 | Tencent | 🟢 Ouvert | 68,5 % | 6 juillet 2026 | Auto-déclaré |
| 5 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 65,2 % | 19 mai 2026 | Auto-déclaré |
| 6 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 64,0 % | 27 avril 2026 | Auto-déclaré |
| 7 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 63,2 % | 22 avril 2026 | Auto-déclaré |
| 8 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 62,7 % | 31 mai 2026 | Auto-déclaré |
| 9 | MiMo-V2-Pro | Xiaomi | 🔒 Propriétaire | 61,5 % | 18 mars 2026 | Auto-déclaré |
| 10 | Qwen3.6-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 60,6 % | 21 avril 2026 | Auto-déclaré |
| 11 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 58,7 % | 31 mars 2026 | Auto-déclaré |
| 12 | MiMo-V2-Omni | Xiaomi | 🔒 Propriétaire | 54,8 % | 18 mars 2026 | Auto-déclaré |
| 13 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,0 % | 16 avril 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués. Score médian de l'ensemble : 63,2 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé dans Claw-Eval traduit une aptitude à achever des tâches multi-étapes tout en respectant les critères de sécurité et de robustesse inscrits dans les rubriques. La notation par trajectoire apporte une granularité utile, car elle évalue le déroulement de l’exécution plutôt que le seul résultat final. Pass@k et Pass^k, calculés sur trois essais, rendent également compte de la réussite et de sa répétabilité.
Cette rigueur méthodologique doit être distinguée de la provenance des résultats publiés dans la base, majoritairement auto-déclarés par les éditeurs. Leur comparaison repose donc largement sur les mesures communiquées par les acteurs évalués, même si le protocole est auditable. Avec une médiane de 63 % et un meilleur résultat de 81 % pour Kimi K2.6, le classement montre une différenciation nette entre les douze modèles et ne paraît pas saturé au sommet. Sa portée reste celle de 300 tâches en anglais, réparties entre neuf catégories. Ces résultats caractérisent donc avant tout les performances sur ce cadre agentique précis, fondé sur 2 159 items de rubrique.
Sources des scores : llm-stats.