Finance Agent
Finance Agent est un benchmark créé par Vals AI pour évaluer les modèles d’intelligence artificielle sur des tâches agentiques d’analyse financière réelle. Il repose sur des questions ouvertes vérifiées, qui mobilisent la recherche d’informations et l’exploitation de documents financiers.
Finance Agent est un benchmark créé par Vals AI pour évaluer les modèles d’intelligence artificielle sur des tâches agentiques d’analyse financière réelle. Il repose sur des questions ouvertes vérifiées, qui mobilisent la recherche d’informations et l’exploitation de documents financiers.
L’évaluation porte notamment sur la récupération de données pertinentes, le raisonnement à partir de ces données, l’exécution de calculs en plusieurs étapes et la synthèse d’analyses exactes. Finance Agent sert ainsi à comparer la capacité des modèles à conduire une démarche financière complète, plutôt qu’à produire une réponse isolée.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Vals AI |
| Capacités mesurées | Analyse financiere agentique : recuperation et raisonnement sur documents financiers, calculs multi-etapes, synthese d'analyses |
| Modalité | Texte |
| Type de questions | Taches agentiques de recherche/analyse financiere reelle (reponse ouverte verifiee) |
| Métrique d'évaluation | Exactitude (reponses verifiees) |
| Accès | Public |
| Langues | Anglais |
| Année de publication | 2025 |
| Ressources | Site / dépôt officiel · Article scientifique |
Classement des modèles (8)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 64,4 % | 16 avril 2026 | Auto-déclaré |
| 2 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 63,3 % | 17 février 2026 | Auto-déclaré |
| 3 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 60,7 % | 5 février 2026 | Auto-déclaré |
| 4 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 60,0 % | 23 avril 2026 | Auto-déclaré |
| 5 | Gemini 3.5 Flash | 🔒 Propriétaire | 57,9 % | 19 mai 2026 | Auto-déclaré | |
| 6 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 56,0 % | 5 mars 2026 | Auto-déclaré |
| 7 | Claude Opus 4.8 | Anthropic | 🔒 Propriétaire | 53,9 % | 28 mai 2026 | Auto-déclaré |
| 8 | Nemotron 3 Ultra (550B A55B) | NVIDIA | 🟢 Ouvert | 53,7 % | 4 juin 2026 | Auto-déclaré |
Classement établi sur 8 modèles évalués, dont 8 de grands éditeurs. Score médian de l'ensemble : 58,9 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un modèle fournit plus souvent des réponses exactes sur des tâches combinant recherche documentaire, raisonnement financier, calculs multi-étapes et synthèse. L’exactitude repose sur des réponses vérifiées, ce qui apporte un critère de correction explicite. La fiabilité comparative doit toutefois être nuancée, car les scores recensés sont majoritairement auto-déclarés par les éditeurs, plutôt que tous mesurés dans un cadre indépendant et uniforme.
Avec une médiane de 59 % sur huit modèles et un meilleur résultat de 64 % pour Claude Opus 4.7, le classement montre un avantage limité du premier modèle par rapport au centre de l’ensemble évalué. Le niveau maximal reste éloigné d’une exactitude complète, ce qui ne traduit pas une saturation du benchmark. Sa portée concerne spécifiquement l’analyse financière agentique en anglais et ne peut être étendue à toutes les capacités générales d’un modèle. Enfin, son accès public appelle à considérer le risque d’exposition préalable aux tâches lors de l’interprétation des résultats, sans que cela établisse une contamination effective.
Sources des scores : llm-stats.