Nexus
Nexus est un benchmark publié par Nexusflow en 2023 pour évaluer la capacité des grands modèles de langage à appeler des fonctions et des outils en zero-shot. Il s’appuie sur des API réelles, notamment des services de cybersécurité liés aux CVE, aux CPE et à VirusTotal.
Nexus est un benchmark publié par Nexusflow en 2023 pour évaluer la capacité des grands modèles de langage à appeler des fonctions et des outils en zero-shot. Il s’appuie sur des API réelles, notamment des services de cybersécurité liés aux CVE, aux CPE et à VirusTotal.
Les modèles doivent générer des appels d’API adaptés sans démonstration préalable. Le benchmark mesure ainsi leur aptitude à transformer une requête en interaction fonctionnelle avec un outil externe, un enjeu distinct de la simple production de texte ou de code.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Nexusflow |
| Capacités mesurées | Appel de fonctions et d'outils en zero-shot sur des API réelles, notamment des outils de cybersécurité (CVE/CPE, VirusTotal) |
| Modalité | Texte |
| Type de questions | appel de fonction / génération d'appels d'API en zero-shot |
| Métrique d'évaluation | taux de réussite de l'appel de fonction |
| Accès | Public |
| Langues | anglais + code (appels d'API) |
| Taille du jeu | 9 tâches (8 publiées, 1 gardée en interne), basées sur des API réelles |
| Année de publication | 2023 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (4)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Llama 3.1 405B Instruct | Meta | 🟢 Ouvert | 58,7 % | 23 juillet 2024 | Auto-déclaré |
| 2 | Llama 3.1 70B Instruct | Meta | 🟢 Ouvert | 56,7 % | 23 juillet 2024 | Auto-déclaré |
| 3 | Llama 3.1 8B Instruct | Meta | 🟢 Ouvert | 38,5 % | 23 juillet 2024 | Auto-déclaré |
| 4 | Llama 3.2 3B Instruct | Meta | 🟢 Ouvert | 34,3 % | 25 septembre 2024 | Auto-déclaré |
Classement établi sur 4 modèles évalués, dont 4 de grands éditeurs. Score médian de l'ensemble : 47,6 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle réussit plus souvent à produire l’appel de fonction attendu face aux tâches proposées. Llama 3.1 405B Instruct arrive en tête des quatre modèles recensés avec 59 %, contre une médiane de 48 %. Cet écart révèle un avantage mesurable, mais le meilleur résultat reste éloigné d’une réussite systématique sur ce périmètre.
L’interprétation exige toutefois de la prudence. Les scores sont majoritairement auto-déclarés par les éditeurs, ce qui offre une garantie moins homogène qu’une évaluation entièrement reproduite par un tiers selon un protocole commun. La petite taille du jeu, neuf tâches dont huit publiques, rend aussi le classement sensible à chaque réussite ou échec. La publication des tâches peut favoriser la contamination des évaluations futures, tandis qu’un nombre limité de cas peut accélérer une éventuelle saturation.
Enfin, Nexus porte sur un champ ciblé : l’appel zero-shot d’API réelles, avec un accent sur des outils de cybersécurité. Le classement renseigne donc sur cette capacité opérationnelle précise, sans constituer une mesure générale des performances d’un modèle.
Sources des scores : llm-stats.