Toolathlon
Toolathlon est un benchmark créé en 2025 par HKUST-NLP pour évaluer des agents d’IA confrontés à des tâches réalistes et longues nécessitant plusieurs outils. Les scénarios sollicitent différentes applications au fil d’interactions prolongées.
Toolathlon est un benchmark créé en 2025 par HKUST-NLP pour évaluer des agents d’IA confrontés à des tâches réalistes et longues nécessitant plusieurs outils. Les scénarios sollicitent différentes applications au fil d’interactions prolongées.
Il mesure la capacité à sélectionner, enchaîner et exécuter correctement des outils, tout en suivant les erreurs d’appel et en conservant le contexte. Son évaluation fondée sur l’exécution vise à apprécier la réussite effective plutôt qu’une simple réponse textuelle.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | HKUST-NLP (Hong Kong University of Science and Technology, NLP Group) |
| Capacités mesurées | Sélection, enchaînement et exécution d'outils multiples sur des tâches longues et diverses ; suivi des erreurs d'appel d'outils et modélisation de contexte long. |
| Modalité | Texte |
| Type de questions | Tâches agentiques d'utilisation d'outils, réalistes et à long horizon (multi-applications, ~20 tours) |
| Métrique d'évaluation | Taux de succès basé sur l'exécution (execution-based) |
| Accès | Public |
| Langues | anglais |
| Taille du jeu | 108 tâches couvrant 32 applications et ~604 outils |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (30)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 75,6 % | 9 juillet 2026 | Auto-déclaré |
| 2 | Kimi K3 | Moonshot AI | ▫ n.d. | 73,2 % | 16 juillet 2026 | Auto-déclaré |
| 3 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 59,9 % | 28 mai 2026 | Auto-déclaré |
| 4 | GPT-5.6 Sol | OpenAI | 🔒 Propriétaire | 58,0 % | 9 juillet 2026 | Auto-déclaré |
| 5 | Gemini 3.5 Flash | 🔒 Propriétaire | 56,5 % | 19 mai 2026 | Auto-déclaré | |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 55,6 % | 23 avril 2026 | Auto-déclaré |
| 7 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 54,6 % | 5 mars 2026 | Auto-déclaré |
| 8 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 54,3 % | 30 juin 2026 | Auto-déclaré |
| 9 | GPT-5.6 Luna | OpenAI | 🔒 Propriétaire | 53,4 % | 9 juillet 2026 | Auto-déclaré |
| 10 | GPT-5.6 Terra | OpenAI | 🔒 Propriétaire | 53,1 % | 9 juillet 2026 | Auto-déclaré |
| 11 | DeepSeek-V4-Pro-Max | DeepSeek | 🟢 Ouvert | 51,8 % | 23 avril 2026 | Auto-déclaré |
| 12 | Seed 2.1 Pro | ByteDance | 🔒 Propriétaire | 50,6 % | 24 juin 2026 | Auto-déclaré |
| 13 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 50,0 % | 20 avril 2026 | Auto-déclaré |
| 14 | Gemini 3 Flash | 🔒 Propriétaire | 49,4 % | 17 décembre 2025 | Auto-déclaré | |
| 15 | Seed 2.1 Turbo | ByteDance | 🔒 Propriétaire | 49,1 % | 24 juin 2026 | Auto-déclaré |
| 16 | Hy3 | Tencent | 🟢 Ouvert | 48,5 % | 6 juillet 2026 | Auto-déclaré |
| 17 | GLM-5.2 | Zhipu AI | 🟢 Ouvert | 48,2 % | 16 juin 2026 | Auto-déclaré |
| 18 | DeepSeek-V4-Flash-Max | DeepSeek | 🟢 Ouvert | 47,8 % | 23 avril 2026 | Auto-déclaré |
| 19 | GPT-5.2 | OpenAI | 🔒 Propriétaire | 46,3 % | 11 décembre 2025 | Auto-déclaré |
| 20 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 46,3 % | 18 mars 2026 | Auto-déclaré |
| 21 | MiniMax M2.1 | MiniMax | 🟢 Ouvert | 43,5 % | 23 décembre 2025 | Auto-déclaré |
| 22 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 42,9 % | 17 mars 2026 | Auto-déclaré |
| 23 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 40,7 % | 7 avril 2026 | Auto-déclaré |
| 24 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 39,8 % | 31 mars 2026 | Auto-déclaré |
| 25 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 38,3 % | 16 février 2026 | Auto-déclaré |
| 26 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 35,5 % | 17 mars 2026 | Auto-déclaré |
| 27 | DeepSeek-V3.2 | DeepSeek | 🟢 Ouvert | 35,2 % | 1 décembre 2025 | Auto-déclaré |
| 28 | DeepSeek-V3.2 (Thinking) | DeepSeek | 🟢 Ouvert | 35,2 % | 1 décembre 2025 | Auto-déclaré |
| 29 | DeepSeek-V3.2-Speciale | DeepSeek | 🟢 Ouvert | 35,2 % | 1 décembre 2025 | Auto-déclaré |
| 30 | Qwen3.6-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 26,9 % | 16 avril 2026 | Auto-déclaré |
Classement établi sur 30 modèles évalués, dont 18 de grands éditeurs. Score médian de l'ensemble : 48,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur Toolathlon indique qu’un modèle mène fréquemment à bien des tâches agentiques complexes, avec une sélection pertinente des outils, un enchaînement approprié des appels et une gestion efficace du contexte long et des erreurs. La métrique fondée sur l’exécution renforce la portée pratique du résultat, car elle mesure l’aboutissement de la tâche. La fiabilité comparative reste toutefois à considérer avec prudence, les scores étant majoritairement auto-déclarés par les éditeurs plutôt que produits dans un protocole centralisé. Le meilleur résultat, 60 % pour Claude Opus 4.8, demeure nettement éloigné d’une réussite systématique, ce qui ne suggère pas une saturation du benchmark. Son avance de 13 points sur la médiane de 47 % met en évidence un écart réel entre la tête du classement et le niveau central des 24 modèles évalués. La portée reste circonscrite aux tâches en anglais, aux applications et outils couverts, ainsi qu’aux scénarios d’environ 20 tours. Enfin, l’accès public peut accroître le risque potentiel d’exposition des modèles aux tâches, ce qui invite à interpréter les résultats avec recul.
Sources des scores : llm-stats.