Finance Agent v2
Finance Agent v2 est un benchmark agentique d’analyse financière créé par Vals AI. Il reproduit des tâches issues de workflows financiers réels, fondées sur la recherche d’informations dans des documents et sur leur exploitation raisonnée.
Finance Agent v2 est un benchmark agentique d’analyse financière créé par Vals AI. Il reproduit des tâches issues de workflows financiers réels, fondées sur la recherche d’informations dans des documents et sur leur exploitation raisonnée.
Il évalue la capacité des modèles à récupérer des documents financiers pertinents, effectuer des calculs en plusieurs étapes, construire des analyses et produire des réponses exactes. Il sert ainsi à comparer des systèmes capables d’enchaîner récupération, raisonnement et modélisation dans un même processus.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Vals AI |
| Capacités mesurées | analyse financière, agents, raisonnement, récupération de documents, calculs multi-étapes, modélisation |
| Modalité | Texte |
| Type de questions | tâches agentiques d'analyse financière (récupération et raisonnement sur documents financiers, calculs multi-étapes) |
| Métrique d'évaluation | exactitude (réponses vérifiées par des experts) |
| Accès | Jeu de test privé (réponses non divulguées) |
| Langues | anglais |
| Taille du jeu | 927 questions vérifiées par experts |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel |
Classement des modèles (26)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Gemini 3.5 Flash | 🔒 Propriétaire | 57,9 % | 19 mai 2026 | n.d. | |
| 2 | Muse Spark 1.1 | Meta | 🔒 Propriétaire | 57,2 % | 9 juillet 2026 | Auto-déclaré |
| 3 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 56,3 % | 9 juin 2026 | n.d. |
| 4 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 53,9 % | 28 mai 2026 | n.d. |
| 5 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 51,8 % | 23 avril 2026 | n.d. |
| 6 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 51,5 % | 16 avril 2026 | n.d. |
| 7 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 51,0 % | 17 février 2026 | n.d. |
| 8 | Qwen3.7 Max | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 48,4 % | 19 mai 2026 | n.d. |
| 9 | MiniMax M3 | MiniMax | 🟢 Ouvert | 48,3 % | 1 juin 2026 | n.d. |
| 10 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 45,4 % | 17 mars 2026 | n.d. |
| 11 | Kimi K2.6 | Moonshot AI | 🟢 Ouvert | 44,9 % | 20 avril 2026 | n.d. |
| 12 | GLM-5.1 | Zhipu AI | 🟢 Ouvert | 44,8 % | 7 avril 2026 | n.d. |
| 13 | Gemini 3.1 Pro Preview | ▫ n.d. | 43,0 % | 19 février 2026 | n.d. | |
| 14 | Gemini 3 Flash | 🔒 Propriétaire | 42,5 % | 17 décembre 2025 | n.d. | |
| 15 | MiMo-V2.5-Pro | Xiaomi | 🟢 Ouvert | 41,5 % | 27 avril 2026 | n.d. |
| 16 | Qwen3.6 Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 40,8 % | 31 mars 2026 | n.d. |
| 17 | GPT-5.4 nano | OpenAI | 🔒 Propriétaire | 38,2 % | 17 mars 2026 | n.d. |
| 18 | Qwen3.7-Plus | Alibaba Cloud / Qwen Team | 🔒 Propriétaire | 38,2 % | 31 mai 2026 | n.d. |
| 19 | Grok 4.3 | xAI | 🔒 Propriétaire | 37,7 % | 6 mai 2026 | n.d. |
| 20 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 37,5 % | 4 juin 2026 | n.d. |
| 21 | MiMo-V2.5 | Xiaomi | 🟢 Ouvert | 36,7 % | 22 avril 2026 | n.d. |
| 22 | Mistral Medium 3.5 | Mistral AI | 🟢 Ouvert | 32,1 % | 29 avril 2026 | n.d. |
| 23 | Claude Haiku 4.5 | Anthropic | 🔒 Propriétaire | 31,0 % | 15 octobre 2025 | n.d. |
| 24 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 30,0 % | 3 mars 2026 | n.d. | |
| 25 | Grok-4.20 Beta | xAI | 🔒 Propriétaire | 28,5 % | 12 mars 2026 | n.d. |
| 26 | MiniMax M2.7 | MiniMax | 🟢 Ouvert | 27,9 % | 18 mars 2026 | n.d. |
Classement établi sur 26 modèles évalués, dont 17 de grands éditeurs. Score médian de l'ensemble : 42,8 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle réussit fréquemment des tâches agentiques complètes d’analyse financière, avec des réponses dont l’exactitude est vérifiée par des experts. Cette validation humaine renforce la rigueur du jeu de questions. La lecture des résultats exige toutefois une distinction entre le protocole du benchmark et la provenance des scores publiés, ceux-ci étant majoritairement auto-déclarés par les éditeurs.
Le classement ne paraît pas saturé : Gemini 3.5 Flash atteint 58 %, tandis que la médiane des 25 modèles évalués s’établit à 43 %. Cet écart révèle un avantage mesurable du meilleur système, mais aussi une marge de progression importante sur l’ensemble des workflows couverts. La portée reste ciblée sur l’analyse financière en anglais et ne permet d’interpréter les performances que dans ce cadre. Le caractère privé du jeu de test et la non-divulgation des réponses réduisent leur exposition directe, sans constituer à eux seuls une garantie absolue contre toute contamination. Le classement renseigne donc surtout sur la combinaison de récupération documentaire, de raisonnement, de calcul multi-étapes et de modélisation.
Sources des scores : llm-stats.