BFCL

BFCL, créé en 2024 par l’UC Berkeley et la Gorilla LLM team, est un benchmark consacré à l’évaluation du function calling. Il examine la capacité d’un modèle à transformer une instruction en langage naturel en appels de fonctions ou d’outils correctement sélectionnés et structurés selon…

BFCL, créé en 2024 par l’UC Berkeley et la Gorilla LLM team, est un benchmark consacré à l’évaluation du function calling. Il examine la capacité d’un modèle à transformer une instruction en langage naturel en appels de fonctions ou d’outils correctement sélectionnés et structurés selon des schémas d’API.

Son protocole couvre des appels simples, multiples, parallèles et multi-tours, dans plusieurs langages de programmation et pour des usages variés. BFCL sert ainsi à comparer l’aptitude opérationnelle des modèles à interagir avec des fonctions externes, au-delà de la seule génération de texte.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkUC Berkeley / Gorilla LLM team
Capacités mesuréesgénéraliste, raisonnement, appels d'outils
ModalitéTexte
Type de questionstâches de tool/function calling avec génération d'appels de fonctions, y compris appels simples, multiples, parallèles et multi-tours
Métrique d'évaluationaccuracy
AccèsPublic
LicenceApache-2.0
Languesanglais, avec fonctions/APIs en Python, Java, JavaScript et REST
Taille du jeuplus de 2 000 paires question-fonction-réponse
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (11)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Llama 3.1 405B InstructMeta🟢 Ouvert88,5 %23 juillet 2024Auto-déclaré
2Llama 3.1 70B InstructMeta🟢 Ouvert84,8 %23 juillet 2024Auto-déclaré
3Llama 3.1 8B InstructMeta🟢 Ouvert76,1 %23 juillet 2024Auto-déclaré
4Nova 2 SonicAmazon🔒 Propriétaire74,5 %2 décembre 2025Auto-déclaré
5Qwen3 235B A22BAlibaba Cloud / Qwen Team🟢 Ouvert70,8 %29 avril 2025Auto-déclaré
6Qwen3 32BAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %29 avril 2025Auto-déclaré
7Qwen3 30B A3BAlibaba Cloud / Qwen Team🟢 Ouvert69,1 %29 avril 2025Auto-déclaré
8Nova ProAmazon🔒 Propriétaire68,4 %20 novembre 2024Auto-déclaré
9Nova LiteAmazon🔒 Propriétaire66,6 %20 novembre 2024Auto-déclaré
10QwQ-32BAlibaba Cloud / Qwen Team🟢 Ouvert66,4 %5 mars 2025Auto-déclaré
11Nova MicroAmazon🔒 Propriétaire56,2 %20 novembre 2024Auto-déclaré

Classement établi sur 11 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BFCL indique qu’un modèle produit fréquemment les appels attendus, avec la bonne fonction, les bons arguments et une structure conforme, y compris lorsque plusieurs opérations doivent être enchaînées ou exécutées en parallèle. L’évaluation par arbre syntaxique abstrait (AST) apporte une vérification structurée et exécutable, plus rigoureuse qu’une simple comparaison textuelle. L’interprétation du classement demande toutefois de distinguer le protocole du mode de publication des résultats, puisque les scores de la base sont majoritairement auto-déclarés par les éditeurs.

Sur les 11 modèles suivis, la médiane de 70 % montre que le function calling reste inégalement maîtrisé. Llama 3.1 405B Instruct atteint 88 %, ce qui le place nettement au-dessus du niveau central tout en laissant une marge avant un résultat parfait. Le classement renseigne spécifiquement sur l’usage d’outils à partir d’instructions en anglais, avec des fonctions ou API en Python, Java, JavaScript et REST. Il ne constitue donc pas une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.