BFCL v2

BFCL v2 est un benchmark créé en 2024 par Berkeley Gorilla, à l’UC Berkeley, pour évaluer les capacités d’appel de fonctions des grands modèles de langage. Il s’appuie sur des scénarios issus de fonctions d’entreprise, de projets open source et de contributions d’utilisateurs.

BFCL v2 est un benchmark créé en 2024 par Berkeley Gorilla, à l’UC Berkeley, pour évaluer les capacités d’appel de fonctions des grands modèles de langage. Il s’appuie sur des scénarios issus de fonctions d’entreprise, de projets open source et de contributions d’utilisateurs.

Il mesure la sélection d’outils pertinents, la production d’appels structurés et exécutables, la gestion d’interactions multi-tours ainsi que la détection des requêtes non pertinentes. Son approche couvre des situations simples, parallèles ou complexes, afin d’apprécier l’aptitude opérationnelle des modèles à utiliser des outils.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkBerkeley Gorilla / UC Berkeley
Capacités mesuréesgénéraliste, raisonnement, appels d'outils
ModalitéTexte
Type de questionstâches de génération et d’évaluation d’appels de fonctions/outils, incluant appels simples, parallèles, multi-tours et détection de fonctions pertinentes ou non pertinentes
Métrique d'évaluationaccuracy, notamment AST accuracy et executable accuracy
AccèsPublic
Languesanglais et prompts multilingues ; fonctions évaluées notamment en Python, Java et JavaScript
Taille du jeu2 251 paires question-fonction-réponse
Année de publication2024
RessourcesSite / dépôt officiel

Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.

Classement des modèles (5)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Llama 3.3 70B InstructMeta🟢 Ouvert77,3 %6 décembre 2024Auto-déclaré
2Llama 3.1 Nemotron Ultra 253B v1NVIDIA🟢 Ouvert74,1 %7 avril 2025Auto-déclaré
3Llama-3.3 Nemotron Super 49B v1NVIDIA🟢 Ouvert73,7 %18 mars 2025Auto-déclaré
4Llama 3.2 3B InstructMeta🟢 Ouvert67,0 %25 septembre 2024Auto-déclaré
5Llama 3.1 Nemotron Nano 8B V1NVIDIA🟢 Ouvert63,6 %18 mars 2025Auto-déclaré

Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 73,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BFCL v2 indique qu’un modèle choisit plus souvent la bonne fonction et génère des appels conformes, notamment sur les plans syntaxique, via l’AST accuracy, et exécutable, via l’executable accuracy. Il reflète aussi une meilleure gestion des fonctions pertinentes ou non pertinentes et des scénarios multi-tours. L’évaluation combine ainsi plusieurs dimensions proches de l’usage réel, dans plusieurs langages de programmation et avec des prompts multilingues. Le recours à des scénarios vivants fournis par des utilisateurs vise également à réduire les risques de contamination et de biais.

La lecture du classement demande toutefois de la prudence, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs. Parmi les cinq modèles présents dans la base, Llama 3.3 70B Instruct arrive en tête à 77 %, contre une médiane de 74 %. Cet écart limité suggère un classement resserré et une possible saturation partielle dans cette sélection. BFCL v2 renseigne spécifiquement sur l’appel de fonctions et d’outils, plutôt que sur l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.