Finance Agent v2

Finance Agent v2 est un benchmark agentique d’analyse financière créé par Vals AI. Il reproduit des tâches issues de workflows financiers réels, fondées sur la recherche d’informations dans des documents et sur leur exploitation raisonnée.

Finance Agent v2 est un benchmark agentique d’analyse financière créé par Vals AI. Il reproduit des tâches issues de workflows financiers réels, fondées sur la recherche d’informations dans des documents et sur leur exploitation raisonnée.

Il évalue la capacité des modèles à récupérer des documents financiers pertinents, effectuer des calculs en plusieurs étapes, construire des analyses et produire des réponses exactes. Il sert ainsi à comparer des systèmes capables d’enchaîner récupération, raisonnement et modélisation dans un même processus.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkVals AI
Capacités mesuréesanalyse financière, agents, raisonnement, récupération de documents, calculs multi-étapes, modélisation
ModalitéTexte
Type de questionstâches agentiques d'analyse financière (récupération et raisonnement sur documents financiers, calculs multi-étapes)
Métrique d'évaluationexactitude (réponses vérifiées par des experts)
AccèsJeu de test privé (réponses non divulguées)
Languesanglais
Taille du jeu927 questions vérifiées par experts
Année de publication2025
RessourcesSite / dépôt officiel

Classement des modèles (26)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Gemini 3.5 FlashGoogle🔒 Propriétaire57,9 %19 mai 2026n.d.
2Muse Spark 1.1Meta🔒 Propriétaire57,2 %9 juillet 2026Auto-déclaré
3Claude Fable 5Anthropic🔒 Propriétaire56,3 %9 juin 2026n.d.
4Claude Opus 4.8Anthropic🔒 Propriétaire53,9 %28 mai 2026n.d.
5GPT-5.5OpenAI🔒 Propriétaire51,8 %23 avril 2026n.d.
6Claude Opus 4.7Anthropic🔒 Propriétaire51,5 %16 avril 2026n.d.
7Claude Sonnet 4.6Anthropic🔒 Propriétaire51,0 %17 février 2026n.d.
8Qwen3.7 MaxAlibaba Cloud / Qwen Team🔒 Propriétaire48,4 %19 mai 2026n.d.
9MiniMax M3MiniMax🟢 Ouvert48,3 %1 juin 2026n.d.
10GPT-5.4 miniOpenAI🔒 Propriétaire45,4 %17 mars 2026n.d.
11Kimi K2.6Moonshot AI🟢 Ouvert44,9 %20 avril 2026n.d.
12GLM-5.1Zhipu AI🟢 Ouvert44,8 %7 avril 2026n.d.
13Gemini 3.1 Pro PreviewGoogle▫ n.d.43,0 %19 février 2026n.d.
14Gemini 3 FlashGoogle🔒 Propriétaire42,5 %17 décembre 2025n.d.
15MiMo-V2.5-ProXiaomi🟢 Ouvert41,5 %27 avril 2026n.d.
16Qwen3.6 PlusAlibaba Cloud / Qwen Team🔒 Propriétaire40,8 %31 mars 2026n.d.
17GPT-5.4 nanoOpenAI🔒 Propriétaire38,2 %17 mars 2026n.d.
18Qwen3.7-PlusAlibaba Cloud / Qwen Team🔒 Propriétaire38,2 %31 mai 2026n.d.
19Grok 4.3xAI🔒 Propriétaire37,7 %6 mai 2026n.d.
20Nemotron 3 Ultra (550B A55B)NVIDIA🟢 Ouvert37,5 %4 juin 2026n.d.
21MiMo-V2.5Xiaomi🟢 Ouvert36,7 %22 avril 2026n.d.
22Mistral Medium 3.5Mistral AI🟢 Ouvert32,1 %29 avril 2026n.d.
23Claude Haiku 4.5Anthropic🔒 Propriétaire31,0 %15 octobre 2025n.d.
24Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire30,0 %3 mars 2026n.d.
25Grok-4.20 BetaxAI🔒 Propriétaire28,5 %12 mars 2026n.d.
26MiniMax M2.7MiniMax🟢 Ouvert27,9 %18 mars 2026n.d.

Classement établi sur 26 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 42,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un modèle réussit fréquemment des tâches agentiques complètes d’analyse financière, avec des réponses dont l’exactitude est vérifiée par des experts. Cette validation humaine renforce la rigueur du jeu de questions. La lecture des résultats exige toutefois une distinction entre le protocole du benchmark et la provenance des scores publiés, ceux-ci étant majoritairement auto-déclarés par les éditeurs.

Le classement ne paraît pas saturé : Gemini 3.5 Flash atteint 58 %, tandis que la médiane des 25 modèles évalués s’établit à 43 %. Cet écart révèle un avantage mesurable du meilleur système, mais aussi une marge de progression importante sur l’ensemble des workflows couverts. La portée reste ciblée sur l’analyse financière en anglais et ne permet d’interpréter les performances que dans ce cadre. Le caractère privé du jeu de test et la non-divulgation des réponses réduisent leur exposition directe, sans constituer à eux seuls une garantie absolue contre toute contamination. Le classement renseigne donc surtout sur la combinaison de récupération documentaire, de raisonnement, de calcul multi-étapes et de modélisation.


Sources des scores : llm-stats.