PinchBench : agentique (OpenClaw, 147 tâches)

PinchBench est un benchmark open source créé par Kilo Code pour évaluer des modèles LLM utilisés comme agents de code OpenClaw. Il repose sur des tâches réelles portant notamment sur le code, la planification, la recherche et la gestion de fichiers.

PinchBench est un benchmark open source créé par Kilo Code pour évaluer des modèles LLM utilisés comme agents de code OpenClaw. Il repose sur des tâches réelles portant notamment sur le code, la planification, la recherche et la gestion de fichiers.

Le benchmark mesure l’usage d’outils, l’enchaînement d’actions en plusieurs étapes, la gestion d’instructions ambiguës et la capacité à mener une tâche à son terme. Il sert ainsi à comparer l’efficacité pratique des modèles agentiques, au-delà de réponses isolées.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkKilo Code (kilo.ai)
Capacités mesuréesCapacités agentiques d'agents de code « OpenClaw » : usage d'outils, enchaînement d'actions multi-étapes, gestion d'instructions ambiguës, accomplissement de tâches réelles.
ModalitéTexte
Type de questionsTâches agentiques réelles (usage d'outils, raisonnement multi-étapes)
Métrique d'évaluationTaux de réussite (+ vitesse, coût) ; notation par checks automatiques, juge LLM ou hybride
AccèsPublic
LanguesAnglais
Taille du jeu147 tâches selon l'intitulé du benchmark (la page officielle mentionne 23 tâches en v1, objectif 100 pour v2)
RessourcesSite / dépôt officiel

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1xAI: Grok Build 0.1xAI▫ n.d.88,9 %20 mai 2026✅ Mesuré
2GPT-5.6 LunaOpenAI🔒 Propriétaire88,7 %9 juillet 2026✅ Mesuré
3Qwen: Qwen3.6 FlashAlibaba Cloud / Qwen Team▫ n.d.88,1 %27 avril 2026✅ Mesuré
4GPT-5.6 SolOpenAI🔒 Propriétaire84,2 %9 juillet 2026✅ Mesuré
5inclusionAI: Ling-2.6-1TInclusionAI▫ n.d.82,6 %23 avril 2026✅ Mesuré
6Gemini 3.1 Pro PreviewGoogle▫ n.d.81,0 %19 février 2026✅ Mesuré
7Grok 4.20xAI▫ n.d.80,3 %31 mars 2026✅ Mesuré
8GPT-5.6 TerraOpenAI🔒 Propriétaire75,9 %9 juillet 2026✅ Mesuré
9Grok 4.5xAI🔒 Propriétaire75,2 %16 juillet 2026✅ Mesuré
10Z.ai: GLM 5 TurboZhipu AI▫ n.d.71,8 %15 mars 2026✅ Mesuré
11Sakana: Fugu UltraSakana AI▫ n.d.69,5 %24 juin 2026✅ Mesuré
12Mistral: Devstral 2 2512Mistral AI🟢 Ouvert69,4 %9 décembre 2025✅ Mesuré
13Claude Haiku 4.5Anthropic🔒 Propriétaire67,7 %15 octobre 2025✅ Mesuré
14Arcee AI: Trinity Large ThinkingArcee AI🟢 Ouvert65,7 %1 avril 2026✅ Mesuré
15mistral-small-2603mistralai▫ n.d.64,6 %✅ Mesuré
16AionLabs: Aion-3.0Aion Labs▫ n.d.61,1 %7 juillet 2026✅ Mesuré
17Arcee AI: Trinity Large PreviewArcee AI🟢 Ouvert53,0 %27 janvier 2026✅ Mesuré
18Claude Sonnet 4Anthropic🔒 Propriétaire48,8 %22 mai 2025✅ Mesuré
19nova-2-lite-v1Amazon🔒 Propriétaire37,6 %2 décembre 2025✅ Mesuré

Classement établi sur 19 modèles évalués, dont 11 de grands éditeurs. Score médian de l'ensemble : 71,8 %.

Notre analyse

Un score élevé traduit une forte capacité à accomplir correctement des tâches agentiques réelles dans l’environnement OpenClaw. Le taux de réussite reste central, tandis que la vitesse et le coût apportent des critères complémentaires pour distinguer des agents affichant une efficacité comparable. La notation repose sur des vérifications automatiques, un juge LLM ou une méthode hybride. Les scores étant au moins partiellement mesurés par un tiers, ils ne relèvent pas uniquement de déclarations des fournisseurs.

Le classement montre un niveau global déjà élevé parmi les 57 modèles évalués, avec une médiane de 72 %. Qwen3.7 Max se détache à 93 %, ce qui laisse encore une marge avant la réussite totale, malgré un risque de saturation progressive dans le haut du classement. La portée demeure ciblée sur des tâches en anglais exécutées comme agents OpenClaw. Le caractère public et open source favorise la reproductibilité, mais impose aussi de considérer le risque de contamination lors de l’interprétation des performances. Enfin, la taille appelle une lecture attentive, l’intitulé annonçant 147 tâches alors que la page officielle décrit 23 tâches en v1 et un objectif de 100 pour v2.


Sources des scores : pinchbench.