ComplexFuncBench

ComplexFuncBench est un benchmark conçu en 2025 par Zhipu AI et l’Université Tsinghua (THUDM) pour évaluer la gestion d’appels de fonctions complexes par les grands modèles de langage.

ComplexFuncBench est un benchmark conçu en 2025 par Zhipu AI et l’Université Tsinghua (THUDM) pour évaluer la gestion d’appels de fonctions complexes par les grands modèles de langage.

Il teste notamment l’enchaînement de plusieurs étapes en un seul tour, le respect de contraintes utilisateur, le raisonnement sur les valeurs de paramètres et le remplissage de paramètres longs. Ses scénarios en anglais peuvent mobiliser des contextes atteignant 128k tokens, afin d’apprécier la capacité des modèles à exécuter correctement des tâches structurées proches de situations réelles.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkZhipu AI / Université Tsinghua (THUDM)
Capacités mesuréesAppel de fonctions multi-étapes en un seul tour, raisonnement sur valeurs de paramètres, contraintes utilisateur, paramètres longs, contexte long 128k
ModalitéTexte
Type de questionsappel de fonctions complexe (multi-étapes, sous contraintes)
Métrique d'évaluationCall Accuracy / Success Rate via le framework ComplexEval
AccèsPublic
Languesanglais
Taille du jeu1000 échantillons d'appels de fonctions complexes
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (7)

#ModèleÉditeurLicenceScoreSortieFiabilité
1GPT-4oOpenAI🔒 Propriétaire66,5 %27 mars 2025Auto-déclaré
2GPT-4.1OpenAI🔒 Propriétaire65,5 %14 avril 2025Auto-déclaré
3Nova 2 SonicAmazon🔒 Propriétaire65,2 %2 décembre 2025Auto-déclaré
4GPT-4.5OpenAI🔒 Propriétaire63,0 %5 mars 2026Auto-déclaré
5GPT-4.1 miniOpenAI🔒 Propriétaire49,3 %14 avril 2025Auto-déclaré
6o3-miniOpenAI🔒 Propriétaire17,6 %30 janvier 2025Auto-déclaré
7GPT-4.1 nanoOpenAI🔒 Propriétaire5,7 %14 avril 2025Auto-déclaré

Classement établi sur 7 modèles évalués, dont 7 de grands éditeurs. Score médian de l'ensemble : 63,0 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle parvient fréquemment à produire des appels de fonctions conformes et à mener à bien des séquences complexes sous contraintes. ComplexEval mesure cette aptitude au moyen de la Call Accuracy et du Success Rate, ce qui centre l’évaluation sur la réussite opérationnelle plutôt que sur une appréciation générale des réponses.

La lecture du classement demande toutefois de la prudence, car les scores recensés sont majoritairement auto-déclarés par les éditeurs. Leur comparabilité dépend donc de l’application cohérente du framework. Parmi les sept modèles évalués, GPT-4o arrive en tête avec 66 %, tandis que la médiane atteint 63 %. Cet écart limité suggère un classement resserré, sans domination très nette, mais le meilleur résultat reste assez éloigné d’une réussite systématique, ce qui ne traduit pas une saturation complète du benchmark. Sa publication et son accès public impliquent aussi que l’exposition aux échantillons peut devenir un enjeu de contamination au fil du temps. Enfin, sa portée reste ciblée sur l’appel de fonctions complexe en anglais, dans cinq scénarios réels, et non sur l’ensemble des capacités générales d’un modèle.


Sources des scores : llm-stats.