BFCL-V4

BFCL-V4, conçu par la Gorilla LLM team de l’UC Berkeley, est un benchmark consacré à l’évaluation des modèles capables d’appeler correctement des fonctions et des API. Il couvre des appels simples, multiples, parallèles ou imbriqués dans différents scénarios de programmation.

BFCL-V4, conçu par la Gorilla LLM team de l’UC Berkeley, est un benchmark consacré à l’évaluation des modèles capables d’appeler correctement des fonctions et des API. Il couvre des appels simples, multiples, parallèles ou imbriqués dans différents scénarios de programmation.

Cette quatrième version élargit l’évaluation aux tâches agentiques, notamment la recherche web, ainsi qu’à la lecture, l’écriture et la mise à jour de mémoire. Elle mesure aussi la robustesse face aux variations de format des prompts et des schémas d’API, afin d’apprécier la fiabilité opérationnelle des modèles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkGorilla LLM team, UC Berkeley
Capacités mesuréesRecherche web agentique, gestion de mémoire (lecture/écriture/mise à jour), robustesse à la variation de format des prompts et schémas d'API.
ModalitéTexte
Type de questionsÉvaluation agentique : recherche web, gestion de mémoire et sensibilité au format (+ appels de fonction)
Métrique d'évaluationExactitude / métriques agentiques par composante
AccèsPublic
LicenceApache-2.0
Languesanglais (+ code/JSON)
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (13)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire75,0 %19 mai 2026Auto-déclaré
2Qwen3.5-397B-A17BAlibaba Cloud / Qwen Team🟢 Ouvert72,9 %16 février 2026Auto-déclaré
3Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire72,9 %31 mai 2026Auto-déclaré
4Qwen3.5-122B-A10BAlibaba Cloud / Qwen Team🟢 Ouvert72,2 %24 février 2026Auto-déclaré
5Qwen3.5-27BAlibaba Cloud / Qwen Team🟢 Ouvert68,5 %24 février 2026Auto-déclaré
6Qwen3.5-35B-A3BAlibaba Cloud / Qwen Team🟢 Ouvert67,3 %24 février 2026Auto-déclaré
7Qwen3.5-9BAlibaba Cloud / Qwen Team🟢 Ouvert66,1 %2 mars 2026Auto-déclaré
8Nova 2 ProAmazon🔒 Propriétaire61,6 %2 décembre 2025Auto-déclaré
9Nova 2 LiteAmazon🔒 Propriétaire60,3 %2 décembre 2025Auto-déclaré
10Nova 2 OmniAmazon🔒 Propriétaire58,3 %2 décembre 2025Auto-déclaré
11Qwen3.5-4BAlibaba Cloud / Qwen Team🟢 Ouvert50,3 %2 mars 2026Auto-déclaré
12Qwen3.5-2BAlibaba Cloud / Qwen Team🟢 Ouvert43,6 %2 mars 2026Auto-déclaré
13Qwen3.5-0.8BAlibaba Cloud / Qwen Team🟢 Ouvert25,3 %2 mars 2026Auto-déclaré

Classement établi sur 13 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 66,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé sur BFCL-V4 indique qu’un modèle exécute avec exactitude les appels de fonction tout en gérant efficacement les différentes composantes agentiques évaluées. Il traduit également une meilleure résistance aux changements de présentation des prompts et des schémas d’API, ainsi qu’une capacité plus solide à manipuler une mémoire et à conduire une recherche web.

L’interprétation du classement demande toutefois de distinguer l’évaluation mesurée de la provenance des résultats. Les scores disponibles sont majoritairement auto-déclarés par les éditeurs, ce qui limite la rigueur comparative par rapport à une mesure entièrement conduite dans un cadre commun et indépendant. Sur les treize modèles recensés, la médiane de 66 % et le meilleur résultat de 75 %, obtenu par Qwen3.7 Max, montrent un avantage du modèle de tête, mais aussi une marge de progression notable. Cet écart au score maximal ne suggère pas une saturation complète du benchmark. La portée reste ciblée sur les appels de fonction, les API et les tâches agentiques couvertes, sans constituer une mesure générale de toutes les capacités d’un modèle.


Sources des scores : llm-stats.