BFCL v2
BFCL v2 est un benchmark créé en 2024 par Berkeley Gorilla, à l’UC Berkeley, pour évaluer les capacités d’appel de fonctions des grands modèles de langage. Il s’appuie sur des scénarios issus de fonctions d’entreprise, de projets open source et de contributions d’utilisateurs.
BFCL v2 est un benchmark créé en 2024 par Berkeley Gorilla, à l’UC Berkeley, pour évaluer les capacités d’appel de fonctions des grands modèles de langage. Il s’appuie sur des scénarios issus de fonctions d’entreprise, de projets open source et de contributions d’utilisateurs.
Il mesure la sélection d’outils pertinents, la production d’appels structurés et exécutables, la gestion d’interactions multi-tours ainsi que la détection des requêtes non pertinentes. Son approche couvre des situations simples, parallèles ou complexes, afin d’apprécier l’aptitude opérationnelle des modèles à utiliser des outils.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Berkeley Gorilla / UC Berkeley |
| Capacités mesurées | généraliste, raisonnement, appels d'outils |
| Modalité | Texte |
| Type de questions | tâches de génération et d’évaluation d’appels de fonctions/outils, incluant appels simples, parallèles, multi-tours et détection de fonctions pertinentes ou non pertinentes |
| Métrique d'évaluation | accuracy, notamment AST accuracy et executable accuracy |
| Accès | Public |
| Langues | anglais et prompts multilingues ; fonctions évaluées notamment en Python, Java et JavaScript |
| Taille du jeu | 2 251 paires question-fonction-réponse |
| Année de publication | 2024 |
| Ressources | Site / dépôt officiel |
Métadonnées descriptives pré-renseignées automatiquement, en cours de relecture éditoriale.
Classement des modèles (5)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Llama 3.3 70B Instruct | Meta | 🟢 Ouvert | 77,3 % | 6 décembre 2024 | Auto-déclaré |
| 2 | Llama 3.1 Nemotron Ultra 253B v1 | NVIDIA | 🟢 Ouvert | 74,1 % | 7 avril 2025 | Auto-déclaré |
| 3 | Llama-3.3 Nemotron Super 49B v1 | NVIDIA | 🟢 Ouvert | 73,7 % | 18 mars 2025 | Auto-déclaré |
| 4 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 67,0 % | 25 septembre 2024 | Auto-déclaré |
| 5 | Llama 3.1 Nemotron Nano 8B V1 | NVIDIA | 🟢 Ouvert | 63,6 % | 18 mars 2025 | Auto-déclaré |
Classement établi sur 5 modèles évalués, dont 5 de grands éditeurs. Score médian de l'ensemble : 73,7 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BFCL v2 indique qu’un modèle choisit plus souvent la bonne fonction et génère des appels conformes, notamment sur les plans syntaxique, via l’AST accuracy, et exécutable, via l’executable accuracy. Il reflète aussi une meilleure gestion des fonctions pertinentes ou non pertinentes et des scénarios multi-tours. L’évaluation combine ainsi plusieurs dimensions proches de l’usage réel, dans plusieurs langages de programmation et avec des prompts multilingues. Le recours à des scénarios vivants fournis par des utilisateurs vise également à réduire les risques de contamination et de biais.
La lecture du classement demande toutefois de la prudence, car les scores disponibles sont majoritairement auto-déclarés par les éditeurs. Parmi les cinq modèles présents dans la base, Llama 3.3 70B Instruct arrive en tête à 77 %, contre une médiane de 74 %. Cet écart limité suggère un classement resserré et une possible saturation partielle dans cette sélection. BFCL v2 renseigne spécifiquement sur l’appel de fonctions et d’outils, plutôt que sur l’ensemble des capacités générales d’un modèle.
Sources des scores : llm-stats.