Legal Agent Benchmark
Legal Agent Benchmark est un benchmark open source créé par Harvey AI pour évaluer des agents d’IA confrontés à un travail juridique complexe et de longue durée. Il reproduit des tâches fondées sur des instructions écrites, un environnement de dossier client et la production d’un livrable.
Legal Agent Benchmark est un benchmark open source créé par Harvey AI pour évaluer des agents d’IA confrontés à un travail juridique complexe et de longue durée. Il reproduit des tâches fondées sur des instructions écrites, un environnement de dossier client et la production d’un livrable.
L’évaluation porte notamment sur l’analyse de dossiers, la synthèse d’informations et la rédaction de mémos ou d’évaluations de risques. Des rubriques conçues par des experts vérifient les faits, les conclusions, les citations, la structure et les étapes du raisonnement.
Carte d'identité
| Caractéristique | Valeur |
|---|---|
| Éditeur du benchmark | Harvey AI |
| Capacités mesurées | Agents IA sur travail juridique complexe et long-horizon : analyse de dossiers clients, synthèse d'information, production de livrables (mémos, évaluations de risques) |
| Modalité | Texte |
| Type de questions | Tâches juridiques long-horizon (instructions écrites + environnement de dossier client + livrables) évaluées contre des rubriques d'experts |
| Métrique d'évaluation | Standard 'all-pass' (tâche réussie uniquement si tous les critères passent) ; 75 000+ critères de rubrique rédigés par des experts |
| Accès | Public |
| Langues | Anglais |
| Taille du jeu | 1 200+ tâches, 24 domaines de pratique juridique, 75 000+ critères de rubrique |
| Année de publication | 2026 |
| Ressources | Site / dépôt officiel |
Classement des modèles (12)
| # | Modèle | Éditeur | Licence | Score | Sortie | Fiabilité |
|---|---|---|---|---|---|---|
| 1 | Claude Fable 5 | Anthropic | 🔒 Propriétaire | 13,3 % | 9 juin 2026 | Auto-déclaré |
| 2 | Claude Opus 4.7 | Anthropic | 🔒 Propriétaire | 7,1 % | 16 avril 2026 | n.d. |
| 3 | Claude Sonnet 5 | Anthropic | 🔒 Propriétaire | 5,8 % | 30 juin 2026 | Auto-déclaré |
| 4 | Claude Sonnet 4.6 | Anthropic | 🔒 Propriétaire | 5,4 % | 17 février 2026 | n.d. |
| 5 | Claude Opus 4.6 | Anthropic | 🔒 Propriétaire | 4,2 % | 5 février 2026 | n.d. |
| 6 | GPT-5.5 | OpenAI | 🔒 Propriétaire | 2,1 % | 23 avril 2026 | n.d. |
| 7 | Gemini 3.5 Flash | 🔒 Propriétaire | 0,8 % | 19 mai 2026 | n.d. | |
| 8 | GPT-4.5 | OpenAI | 🔒 Propriétaire | 0,4 % | 5 mars 2026 | n.d. |
| 9 | GPT-5.4 mini | OpenAI | 🔒 Propriétaire | 0,0 % | 17 mars 2026 | n.d. |
| 10 | Gemini 3 Flash | 🔒 Propriétaire | 0,0 % | 17 décembre 2025 | n.d. | |
| 11 | Gemini 3.1 Flash-Lite | 🔒 Propriétaire | 0,0 % | 3 mars 2026 | n.d. | |
| 12 | Gemini 3.1 Pro Preview | ▫ n.d. | 0,0 % | 19 février 2026 | n.d. |
Classement établi sur 12 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 1,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).
Notre analyse
Un score élevé indique qu’un agent satisfait intégralement les exigences des tâches réussies. Le standard « all-pass » est particulièrement strict : l’échec d’un seul critère de rubrique suffit à faire échouer la tâche entière. Cette méthode valorise donc la complétude et la fiabilité du livrable plutôt qu’une réussite partielle. La lecture des résultats appelle néanmoins une distinction entre la rigueur du protocole et la provenance des scores, ceux de la base étant majoritairement auto-déclarés par les éditeurs.
Le classement montre une difficulté élevée pour les modèles évalués. Avec une médiane de 1 % et un meilleur résultat de 13 % pour Claude Fable 5, il ne présente pas de signe de saturation. Sa portée reste centrée sur le travail juridique en anglais et sur les domaines de pratique couverts. Son accès public doit aussi être pris en compte dans l’interprétation à long terme, notamment face au risque de contamination des évaluations. Les écarts observés reflètent avant tout la capacité à produire des livrables juridiques complets sous des contraintes cumulatives.
Sources des scores : llm-stats.