PinchBench : agentique (OpenClaw, 147 tâches)
PinchBench est un benchmark open source créé par Kilo Code pour évaluer des modèles LLM utilisés comme agents de code OpenClaw. Il repose sur des tâches réelles portant notamment sur le code, la planification, la recherche et la gestion de fichiers.
PinchBench est un benchmark open source créé par Kilo Code pour évaluer des modèles LLM utilisés comme agents de code OpenClaw. Il repose sur des tâches réelles portant notamment sur le code, la planification, la recherche et la gestion de fichiers.
Le benchmark mesure l’usage d’outils, l’enchaînement d’actions en plusieurs étapes, la gestion d’instructions ambiguës et la capacité à mener une tâche à son terme. Il sert ainsi à comparer l’efficacité pratique des modèles agentiques, au-delà de réponses isolées.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Kilo Code (kilo.ai) |
| Capacités mesurées | Capacités agentiques d'agents de code « OpenClaw » : usage d'outils, enchaînement d'actions multi-étapes, gestion d'instructions ambiguës, accomplissement de tâches réelles. |
| Modalité | Texte |
| Type de questions | Tâches agentiques réelles (usage d'outils, raisonnement multi-étapes) |
| Métrique d'évaluation | Taux de réussite (+ vitesse, coût) ; notation par checks automatiques, juge LLM ou hybride |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 147 tâches selon l'intitulé du benchmark (la page officielle mentionne 23 tâches en v1, objectif 100 pour v2) |
| Ressources | Site / dépôt officiel |
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | xAI: Grok Build 0.1 | xAI | ▫ n.d. | 88,9 % | 20 mai 2026 | ✅ Mesuré |
| 2 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 88,7 % | 9 juillet 2026 | ✅ Mesuré |
| 3 | Qwen: Qwen3.6 Flash | Alibaba Cloud / Qwen Team | ▫ n.d. | 88,1 % | 27 avril 2026 | ✅ Mesuré |
| 4 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 84,2 % | 9 juillet 2026 | ✅ Mesuré |
| 5 | inclusionAI: Ling-2.6-1T | InclusionAI | ▫ n.d. | 82,6 % | 23 avril 2026 | ✅ Mesuré |
| 6 | Gemini 3.1 Pro Preview | ▫ n.d. | 81,0 % | 19 février 2026 | ✅ Mesuré | |
| 7 | Grok 4.20 | xAI | ▫ n.d. | 80,3 % | 31 mars 2026 | ✅ Mesuré |
| 8 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 75,9 % | 9 juillet 2026 | ✅ Mesuré |
| 9 | Grok 4.5 | xAI | 🔒 Propriétaire | 75,2 % | 16 juillet 2026 | ✅ Mesuré |
| 10 | Z.ai: GLM 5 Turbo | Zhipu AI | ▫ n.d. | 71,8 % | 15 mars 2026 | ✅ Mesuré |
| 11 | Sakana: Fugu Ultra | Sakana AI | ▫ n.d. | 69,5 % | 24 juin 2026 | ✅ Mesuré |
| 12 | Mistral: Devstral 2 2512 | Mistral AI | 🟢 Ouvert | 69,4 % | 9 décembre 2025 | ✅ Mesuré |
| 13 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 67,7 % | 15 octobre 2025 | ✅ Mesuré |
| 14 | Arcee AI: Trinity Large Thinking | Arcee AI | 🟢 Ouvert | 65,7 % | 1 avril 2026 | ✅ Mesuré |
| 15 | mistral-small-2603 | mistralai | ▫ n.d. | 64,6 % | — | ✅ Mesuré |
| 16 | AionLabs: Aion-3.0 | Aion Labs | ▫ n.d. | 61,1 % | 7 juillet 2026 | ✅ Mesuré |
| 17 | Arcee AI: Trinity Large Preview | Arcee AI | 🟢 Ouvert | 53,0 % | 27 janvier 2026 | ✅ Mesuré |
| 18 | Claude Sonnet 4 | Anthropic | 🔒 Propriétaire | 48,8 % | 22 mai 2025 | ✅ Mesuré |
| 19 | nova-2-lite-v1 | Amazon | 🔒 Propriétaire | 37,6 % | 2 décembre 2025 | ✅ Mesuré |
Classement établi sur 19 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 71,8 %.
Notre analyse
Un score élevé traduit une forte capacité à accomplir correctement des tâches agentiques réelles dans l’environnement OpenClaw. Le taux de réussite reste central, tandis que la vitesse et le coût apportent des critères complémentaires pour distinguer des agents affichant une efficacité comparable. La notation repose sur des vérifications automatiques, un juge LLM ou une méthode hybride. Les scores étant au moins partiellement mesurés par un tiers, ils ne relèvent pas uniquement de déclarations des fournisseurs.
Le classement montre un niveau global déjà élevé parmi les 57 modèles évalués, avec une médiane de 72 %. Qwen3.7 Max se détache à 93 %, ce qui laisse encore une marge avant la réussite totale, malgré un risque de saturation progressive dans le haut du classement. La portée demeure ciblée sur des tâches en anglais exécutées comme agents OpenClaw. Le caractère public et open source favorise la reproductibilité, mais impose aussi de considérer le risque de contamination lors de l’interprétation des performances. Enfin, la taille appelle une lecture attentive, l’intitulé annonçant 147 tâches alors que la page officielle décrit 23 tâches en v1 et un objectif de 100 pour v2.
Sources des scores : pinchbench.