BFCL-V4
BFCL-V4, conçu par la Gorilla LLM team de l’UC Berkeley, est un benchmark consacré à l’évaluation des modèles capables d’appeler correctement des fonctions et des API. Il couvre des appels simples, multiples, parallèles ou imbriqués dans différents scénarios de programmation.
BFCL-V4, conçu par la Gorilla LLM team de l’UC Berkeley, est un benchmark consacré à l’évaluation des modèles capables d’appeler correctement des fonctions et des API. Il couvre des appels simples, multiples, parallèles ou imbriqués dans différents scénarios de programmation.
Cette quatrième version élargit l’évaluation aux tâches agentiques, notamment la recherche web, ainsi qu’à la lecture, l’écriture et la mise à jour de mémoire. Elle mesure aussi la robustesse face aux variations de format des prompts et des schémas d’API, afin d’apprécier la fiabilité opérationnelle des modèles.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Gorilla LLM team, UC Berkeley |
| Capacités mesurées | Recherche web agentique, gestion de mémoire (lecture/écriture/mise à jour), robustesse à la variation de format des prompts et schémas d'API. |
| Modalité | Texte |
| Type de questions | Évaluation agentique : recherche web, gestion de mémoire et sensibilité au format (+ appels de fonction) |
| Métrique d'évaluation | Exactitude / métriques agentiques par composante |
| Accès | Public |
| Licence | Apache-2.0 |
| Langues | anglais (+ code/JSON) |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (13)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 75,0 % | 19 mai 2026 | Auto-déclaré |
| 2 | Qwen3.5-397B-A17B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,9 % | 16 février 2026 | Auto-déclaré |
| 3 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 72,9 % | 31 mai 2026 | Auto-déclaré |
| 4 | Qwen3.5-122B-A10B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 72,2 % | 24 février 2026 | Auto-déclaré |
| 5 | Qwen3.5-27B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 68,5 % | 24 février 2026 | Auto-déclaré |
| 6 | Qwen3.5-35B-A3B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 67,3 % | 24 février 2026 | Auto-déclaré |
| 7 | Qwen3.5-9B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 66,1 % | 2 mars 2026 | Auto-déclaré |
| 8 | Nova 2 Pro | Amazon | 🔒 Propriétaire | 61,6 % | 2 décembre 2025 | Auto-déclaré |
| 9 | Nova 2 Lite | Amazon | 🔒 Propriétaire | 60,3 % | 2 décembre 2025 | Auto-déclaré |
| 10 | Nova 2 Omni | Amazon | 🔒 Propriétaire | 58,3 % | 2 décembre 2025 | Auto-déclaré |
| 11 | Qwen3.5-4B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 50,3 % | 2 mars 2026 | Auto-déclaré |
| 12 | Qwen3.5-2B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 43,6 % | 2 mars 2026 | Auto-déclaré |
| 13 | Qwen3.5-0.8B | Alibaba Cloud / Qwen Team | 🟢 Ouvert | 25,3 % | 2 mars 2026 | Auto-déclaré |
Classement établi sur 13 modèles évalués, dont 3 de grands éditeurs. Score médian de l'ensemble : 66,1 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé sur BFCL-V4 indique qu’un modèle exécute avec exactitude les appels de fonction tout en gérant efficacement les différentes composantes agentiques évaluées. Il traduit également une meilleure résistance aux changements de présentation des prompts et des schémas d’API, ainsi qu’une capacité plus solide à manipuler une mémoire et à conduire une recherche web.
L’interprétation du classement demande toutefois de distinguer l’évaluation mesurée de la provenance des résultats. Les scores disponibles sont majoritairement auto-déclarés par les éditeurs, ce qui limite la rigueur comparative par rapport à une mesure entièrement conduite dans un cadre commun et indépendant. Sur les treize modèles recensés, la médiane de 66 % et le meilleur résultat de 75 %, obtenu par Qwen3.7 Max, montrent un avantage du modèle de tête, mais aussi une marge de progression notable. Cet écart au score maximal ne suggère pas une saturation complète du benchmark. La portée reste ciblée sur les appels de fonction, les API et les tâches agentiques couvertes, sans constituer une mesure générale de toutes les capacités d’un modèle.
Sources des scores : llm-stats.