BFCL-v3

BFCL-v3 est un benchmark conçu en 2024 par la Gorilla LLM team de l’UC Berkeley pour évaluer les capacités d’appel de fonctions des grands modèles de langage dans des interactions agentiques.

BFCL-v3 est un benchmark conçu en 2024 par la Gorilla LLM team de l’UC Berkeley pour évaluer les capacités d’appel de fonctions des grands modèles de langage dans des interactions agentiques.

Il confronte les modèles à des échanges multi-tours et à des tâches en plusieurs étapes, qui exigent de conserver le contexte, de décider quand et comment appeler des fonctions, puis d’enchaîner des appels séquentiels ou imbriqués. Il mesure ainsi l’aptitude à exécuter correctement des demandes complexes ayant des effets sur un système.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGorilla LLM team, UC Berkeley
Capacités mesuréesMaintien du contexte conversationnel sur plusieurs tours, décisions dynamiques sur quand/comment appeler des fonctions, gestion d'appels séquentiels et imbriqués.
ModalitéTexte
Type de questionsAppels de fonction multi-tours et multi-étapes (function calling agentique)
Métrique d'évaluationExactitude (vérification AST + évaluation basée sur l'état du système)
AccèsPublic
LicenceApache-2.0
Languesanglais (+ code/JSON)
Taille du jeu~1000 cas de test, dont 800 tâches multi-tours (~200 par type)
Année de publication2024
RessourcesSite / dépôt officiel

Classement des modèles (19)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GLM-4.5Zhipu AI🟢 Ouvert77,8 %28 juillet 2025Auto-déclaré
2GLM-4.5-AirZhipu AI🟢 Ouvert76,4 %28 juillet 2025Auto-déclaré
3LongCat-Flash-ThinkingMeituan🟢 Ouvert74,4 %22 septembre 2025Auto-déclaré
4MAI-Thinking-1Microsoft🔒 Propriétaire72,0 %2 juin 2026Auto-déclaré
5Qwen3-Next-80B-A3B-ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert72,0 %10 septembre 2025Auto-déclaré
6Qwen3 VL 235B A22B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert71,9 %22 septembre 2025Auto-déclaré
7Qwen3-235B-A22B-Thinking-2507Alibaba Cloud / Qwen Team🟢 Ouvert71,9 %25 juillet 2025Auto-déclaré
8Qwen3 VL 32B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert71,7 %22 septembre 2025Auto-déclaré
9Qwen3-235B-A22B-Instruct-2507Alibaba Cloud / Qwen Team🟢 Ouvert70,9 %22 juillet 2025Auto-déclaré
10Qwen3-Next-80B-A3B-InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,3 %10 septembre 2025Auto-déclaré
11Qwen3 VL 32B InstructAlibaba Cloud / Qwen Team🟢 Ouvert70,2 %22 septembre 2025Auto-déclaré
12Qwen3-Coder 480B A35B InstructAlibaba Cloud / Qwen Team🟢 Ouvert68,7 %31 janvier 2025Auto-déclaré
13Qwen3 VL 30B A3B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert68,6 %22 septembre 2025Auto-déclaré
14Qwen3 VL 235B A22B InstructAlibaba Cloud / Qwen Team🟢 Ouvert67,7 %22 septembre 2025Auto-déclaré
15Qwen3 VL 4B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert67,3 %22 septembre 2025Auto-déclaré
16Qwen3 VL 30B A3B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,3 %22 septembre 2025Auto-déclaré
17Qwen3 VL 8B InstructAlibaba Cloud / Qwen Team🟢 Ouvert66,3 %22 septembre 2025Auto-déclaré
18Qwen3 VL 4B InstructAlibaba Cloud / Qwen Team🟢 Ouvert63,3 %22 septembre 2025Auto-déclaré
19Qwen3 VL 8B ThinkingAlibaba Cloud / Qwen Team🟢 Ouvert63,0 %22 septembre 2025Auto-déclaré

Classement établi sur 19 modèles évalués, dont 1 de grands éditeurs. Score médian de l'ensemble : 70,3 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BFCL-v3 indique qu’un modèle sait maintenir les informations pertinentes au fil d’une conversation et orchestrer plusieurs appels de fonctions jusqu’à l’état attendu. L’exactitude combine une vérification AST et une évaluation fondée sur l’état du système, ce qui contrôle à la fois la structure des appels, le chemin d’exécution et leurs effets. Cette rigueur méthodologique doit toutefois être distinguée de la provenance des résultats, puisque les scores recensés sont majoritairement auto-déclarés par les éditeurs.

Le classement place GLM-4.5 en tête à 78 %, contre une médiane de 70 % pour les 19 modèles évalués. Cet écart montre un avantage mesurable, sans indiquer une saturation complète puisque le meilleur résultat reste éloigné de l’exactitude maximale. La portée demeure celle d’environ 1 000 cas, centrés notamment sur le contrôle de véhicules, les bots de trading, la réservation de voyages et la gestion de fichiers. Enfin, l’accès public appelle à considérer le risque de contamination lors de l’interprétation des performances, particulièrement pour des modèles susceptibles d’avoir été exposés au benchmark.


Sources des scores : llm-stats.