BFCL-v3
BFCL-v3 est un benchmark conçu en 2024 par la Gorilla LLM team de l’UC Berkeley pour évaluer les capacités d’appel de fonctions des grands modèles de langage dans des interactions agentiques.
BFCL-v3 est un benchmark conçu en 2024 par la Gorilla LLM team de l’UC Berkeley pour évaluer les capacités d’appel de fonctions des grands modèles de langage dans des interactions agentiques.
Il confronte les modèles à des échanges multi-tours et à des tâches en plusieurs étapes, qui exigent de conserver le contexte, de décider quand et comment appeler des fonctions, puis d’enchaîner des appels séquentiels ou imbriqués. Il mesure ainsi l’aptitude à exécuter correctement des demandes complexes ayant des effets sur un système.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Gorilla LLM team, UC Berkeley |
| Capacités mesurées | Maintien du contexte conversationnel sur plusieurs tours, décisions dynamiques sur quand/comment appeler des fonctions, gestion d'appels séquentiels et imbriqués. |
| Modalité | Texte |
| Type de questions | Appels de fonction multi-tours et multi-étapes (function calling agentique) |
| Métrique d'évaluation | Exactitude (vérification AST + évaluation basée sur l'état du système) |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais (+ code/JSON) |
| Taille du jeu | ~1000 cas de test, dont 800 tâches multi-tours (~200 par type) |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Classement des modèles (19)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | GLM-4.5 | Zhipu AI | 🟢 Ouvert | 77,8 % | 28 juillet 2025 | Auto-déclaré |
| 2 | GLM-4.5-Air | Zhipu AI | 🟢 Ouvert | 76,4 % | 28 juillet 2025 | Auto-déclaré |
| 3 | LongCat-Flash-Thinking | Meituan | 🟢 Ouvert | 74,4 % | 22 septembre 2025 | Auto-déclaré |
| 4 | MAI-Thinking-1 | Microsoft | 🔒 Propriétaire | 72,0 % | 2 juin 2026 | Auto-déclaré |
| 5 | Qwen3-Next-80B-A3B-Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,0 % | 10 septembre 2025 | Auto-déclaré |
| 6 | Qwen3 VL 235B A22B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,9 % | 22 septembre 2025 | Auto-déclaré |
| 7 | Qwen3-235B-A22B-Thinking-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,9 % | 25 juillet 2025 | Auto-déclaré |
| 8 | Qwen3 VL 32B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 71,7 % | 22 septembre 2025 | Auto-déclaré |
| 9 | Qwen3-235B-A22B-Instruct-2507 | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,9 % | 22 juillet 2025 | Auto-déclaré |
| 10 | Qwen3-Next-80B-A3B-Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 10 septembre 2025 | Auto-déclaré |
| 11 | Qwen3 VL 32B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,2 % | 22 septembre 2025 | Auto-déclaré |
| 12 | Qwen3-Coder 480B A35B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,7 % | 31 janvier 2025 | Auto-déclaré |
| 13 | Qwen3 VL 30B A3B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,6 % | 22 septembre 2025 | Auto-déclaré |
| 14 | Qwen3 VL 235B A22B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,7 % | 22 septembre 2025 | Auto-déclaré |
| 15 | Qwen3 VL 4B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,3 % | 22 septembre 2025 | Auto-déclaré |
| 16 | Qwen3 VL 30B A3B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,3 % | 22 septembre 2025 | Auto-déclaré |
| 17 | Qwen3 VL 8B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,3 % | 22 septembre 2025 | Auto-déclaré |
| 18 | Qwen3 VL 4B Instruct | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,3 % | 22 septembre 2025 | Auto-déclaré |
| 19 | Qwen3 VL 8B Thinking | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 63,0 % | 22 septembre 2025 | Auto-déclaré |
Classement établi sur 19 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BFCL-v3 indique qu’un modèle sait maintenir les informations pertinentes au fil d’une conversation et orchestrer plusieurs appels de fonctions jusqu’à l’état attendu. L’exactitude combine une vérification AST et une évaluation fondée sur l’état du système, ce qui contrôle à la fois la structure des appels, le chemin d’exécution et leurs effets. Cette rigueur méthodologique doit toutefois être distinguée de la provenance des résultats, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs.
Le classement place GLM-4.5 en tête à 78 %, contre une médiane de 70 % pour les 19 modèles évalués. Cet écart montre un avantage mesurable, sans indiquer une saturation complète puisque le meilleur résultat reste éloigné de l’exactitude maximale. La portée demeure celle d’environ 1 000 cas, centrés notamment sur le contrôle de véhicules, les bots de trading, la réservation de voyages et la gestion de fichiers. Enfin, l’accès public appelle à considérer le risque de contamination lors de l’interprétation des performances, particulièrement pour des modèles susceptibles d’avoir été exposés au benchmark.
Sources des scores : llm-stats.