BFCL
BFCL, créé en 2024 par l’UC Berkeley et la Gorilla LLM team, est un benchmark consacré à l’évaluation du function calling. Il examine la capacité d’un modèle à transformer une instruction en langage naturel en appels de fonctions ou d’outils correctement sélectionnés et structurés selon…
BFCL, créé en 2024 par l’UC Berkeley et la Gorilla LLM team, est un benchmark consacré à l’évaluation du function calling. Il examine la capacité d’un modèle à transformer une instruction en langage naturel en appels de fonctions ou d’outils correctement sélectionnés et structurés selon des schémas d’API.
Son protocole couvre des appels simples, multiples, parallèles et multi-tours, dans plusieurs langages de programmation et pour des usages variés. BFCL sert ainsi à comparer l’aptitude opérationnelle des modèles à interagir avec des fonctions externes, au-delà de la seule génération de texte.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | UC Berkeley / Gorilla LLM team |
| Capacités mesurées | généraliste, raisonnement, appels d'outils |
| Modalité | Texte |
| Type de questions | tâches de tool/function calling avec génération d'appels de fonctions, y compris appels simples, multiples, parallèles et multi-tours |
| Métrique d'évaluation | accuracy |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais, avec fonctions/APIs en Python, Java, JavaScript et REST |
| Taille du jeu | plus de 2 000 paires question-fonction-réponse |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (11)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 88,5 % | 23 juillet 2024 | Auto-déclaré |
| 2 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 84,8 % | 23 juillet 2024 | Auto-déclaré |
| 3 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 76,1 % | 23 juillet 2024 | Auto-déclaré |
| 4 | Nova 2 Sonic | Amazon | 🔒 Propriétaire | 74,5 % | 2 décembre 2025 | Auto-déclaré |
| 5 | Qwen3 235B A22B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,8 % | 29 avril 2025 | Auto-déclaré |
| 6 | Qwen3 32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 70,3 % | 29 avril 2025 | Auto-déclaré |
| 7 | Qwen3 30B A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 69,1 % | 29 avril 2025 | Auto-déclaré |
| 8 | Nova Pro | Amazon | 🔒 Propriétaire | 68,4 % | 20 novembre 2024 | Auto-déclaré |
| 9 | Nova Lite | Amazon | 🔒 Propriétaire | 66,6 % | 20 novembre 2024 | Auto-déclaré |
| 10 | QwQ-32B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,4 % | 5 mars 2025 | Auto-déclaré |
| 11 | Nova Micro | Amazon | 🔒 Propriétaire | 56,2 % | 20 novembre 2024 | Auto-déclaré |
Classement établi sur 11 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BFCL indique qu’un modèle produit fréquemment les appels attendus, avec la bonne fonction, les bons arguments et une structure conforme, y compris lorsque plusieurs opérations doivent être enchaînées ou exécutées en parallèle. L’évaluation par arbre syntaxique abstrait (AST) apporte une vérification structurée et exécutable, plus rigoureuse qu’une simple comparaison textuelle. L’interprétation du classement demande toutefois de distinguer le protocole du mode de publication des résultats, puisque les scores de la base sont majoritairement auto-déclarés par les éditeurs.
Sur les 11 modèles suivis, la médiane de 70 % montre que le function calling reste inégalement maîtrisé. Llama 3.1 405B Instruct atteint 88 %, ce qui le place nettement au-dessus du niveau central tout en laissant une marge avant un résultat parfait. Le classement renseigne spécifiquement sur l’usage d’outils à partir d’instructions en anglais, avec des fonctions ou API en Python, Java, JavaScript et REST. Il ne constitue donc pas une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.