Finance Agent

Finance Agent est un benchmark créé par Vals AI pour évaluer les modèles d’intelligence artificielle sur des tâches agentiques d’analyse financière réelle. Il repose sur des questions ouvertes vérifiées, qui mobilisent la recherche d’informations et l’exploitation de documents financiers.

Finance Agent est un benchmark créé par Vals AI pour évaluer les modèles d’intelligence artificielle sur des tâches agentiques d’analyse financière réelle. Il repose sur des questions ouvertes vérifiées, qui mobilisent la recherche d’informations et l’exploitation de documents financiers.

L’évaluation porte notamment sur la récupération de données pertinentes, le raisonnement à partir de ces données, l’exécution de calculs en plusieurs étapes et la synthèse d’analyses exactes. Finance Agent sert ainsi à comparer la capacité des modèles à conduire une démarche financière complète, plutôt qu’à produire une réponse isolée.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkVals AI
Capacités mesuréesAnalyse financiere agentique : recuperation et raisonnement sur documents financiers, calculs multi-etapes, synthese d'analyses
ModalitéTexte
Type de questionsTaches agentiques de recherche/analyse financiere reelle (reponse ouverte verifiee)
Métrique d'évaluationExactitude (reponses verifiees)
AccèsPublic
LanguesAnglais
Année de publication2025
RessourcesSite / dépôt officiel · Article scientifique

Classement des modèles (8)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Opus 4.7Anthropic🔒 Propriétaire64,4 %16 avril 2026Auto-déclaré
2Claude Sonnet 4.6Anthropic🔒 Propriétaire63,3 %17 février 2026Auto-déclaré
3Claude Opus 4.6Anthropic🔒 Propriétaire60,7 %5 février 2026Auto-déclaré
4GPT-5.5OpenAI🔒 Propriétaire60,0 %23 avril 2026Auto-déclaré
5Gemini 3.5 FlashGoogle🔒 Propriétaire57,9 %19 mai 2026Auto-déclaré
6GPT-4.5OpenAI🔒 Propriétaire56,0 %5 mars 2026Auto-déclaré
7Claude Opus 4.8Anthropic🔒 Propriétaire53,9 %28 mai 2026Auto-déclaré
8Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert53,7 %4 juin 2026Auto-déclaré

Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 58,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle fournit plus souvent des réponses exactes sur des tâches combinant recherche documentaire, raisonnement financier, calculs multi-étapes et synthèse. L’exactitude repose sur des réponses vérifiées, ce qui apporte un critère de correction explicite. La fiabilité comparative doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que tous mesurés dans un cadre indépendant et uniforme.

Avec une médiane de 59 % sur huit modèles et un meilleur résultat de 64 % pour Claude Opus 4.7, le classement montre un avantage limité du premier modèle par rapport au centre de l’ensemble évalué. Le niveau maximal reste éloigné d’une exactitude complète, ce qui ne traduit pas une saturation du benchmark. Sa portée concerne spécifiquement l’analyse financière agentique en anglais et ne peut être étendue à toutes les capacités générales d’un modèle. Enfin, son accès public appelle à considérer le risque d’exposition préalable aux tâches lors de l’interprétation des résultats, sans que cela établisse une contamination effective.


Sources des scores : llm-stats.