Nexus

Nexus est un benchmark publié par Nexusflow en 2023 pour évaluer la capacité des grands modèles de langage à appeler des fonctions et des outils en zero-shot. Il s’appuie sur des API réelles, notamment des services de cybersécurité liés aux CVE, aux CPE et à VirusTotal.

Nexus est un benchmark publié par Nexusflow en 2023 pour évaluer la capacité des grands modèles de langage à appeler des fonctions et des outils en zero-shot. Il s’appuie sur des API réelles, notamment des services de cybersécurité liés aux CVE, aux CPE et à VirusTotal.

Les modèles doivent générer des appels d’API adaptés sans démonstration préalable. Le benchmark mesure ainsi leur aptitude à transformer une requête en interaction fonctionnelle avec un outil externe, un enjeu distinct de la simple production de texte ou de code.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkNexusflow
Capacités mesuréesAppel de fonctions et d'outils en zero-shot sur des API réelles, notamment des outils de cybersécurité (CVE/CPE, VirusTotal)
ModalitéTexte
Type de questionsappel de fonction / génération d'appels d'API en zero-shot
Métrique d'évaluationtaux de réussite de l'appel de fonction
AccèsPublic
Languesanglais + code (appels d'API)
Taille du jeu9 tâches (8 publiées, 1 gardée en interne), basées sur des API réelles
Année de publication2023
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (4)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Llama 3.1 405B InstructMeta🟢 Ouvert58,7 %23 juillet 2024Auto-déclaré
2Llama 3.1 70B InstructMeta🟢 Ouvert56,7 %23 juillet 2024Auto-déclaré
3Llama 3.1 8B InstructMeta🟢 Ouvert38,5 %23 juillet 2024Auto-déclaré
4Llama 3.2 3B InstructMeta🟢 Ouvert34,3 %25 septembre 2024Auto-déclaré

Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 47,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle réussit plus souvent à produire l’appel de fonction attendu face aux tâches proposées. Llama 3.1 405B Instruct arrive en tête des quatre modèles recensés avec 59 %, contre une médiane de 48 %. Cet écart révèle un avantage mesurable, mais le meilleur résultat reste éloigné d’une réussite systématique sur ce périmètre.

L’interprétation exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement reproduite par un tiers selon un protocole commun. La petite taille du jeu, neuf tâches dont huit publiques, rend aussi le classement sensible à chaque réussite ou échec. La publication des tâches peut favoriser la contamination des évaluations futures, tandis qu’un nombre limité de cas peut accélérer une éventuelle saturation.

Enfin, Nexus porte sur un champ ciblé : l’appel zero-shot d’API réelles, avec un accent sur des outils de cybersécurité. Le classement renseigne donc sur cette capacité opérationnelle précise, sans constituer une mesure générale des performances d’un modèle.


Sources des scores : llm-stats.