Legal Agent Benchmark

Legal Agent Benchmark est un benchmark open source créé par Harvey AI pour évaluer des agents d’IA confrontés à un travail juridique complexe et de longue durée. Il reproduit des tâches fondées sur des instructions écrites, un environnement de dossier client et la production d’un livrable.

Legal Agent Benchmark est un benchmark open source créé par Harvey AI pour évaluer des agents d’IA confrontés à un travail juridique complexe et de longue durée. Il reproduit des tâches fondées sur des instructions écrites, un environnement de dossier client et la production d’un livrable.

L’évaluation porte notamment sur l’analyse de dossiers, la synthèse d’informations et la rédaction de mémos ou d’évaluations de risques. Des rubriques conçues par des experts vérifient les faits, les conclusions, les citations, la structure et les étapes du raisonnement.

Carte d'identité

CaractéristiqueValeur
Éditeur du benchmarkHarvey AI
Capacités mesuréesAgents IA sur travail juridique complexe et long-horizon : analyse de dossiers clients, synthèse d'information, production de livrables (mémos, évaluations de risques)
ModalitéTexte
Type de questionsTâches juridiques long-horizon (instructions écrites + environnement de dossier client + livrables) évaluées contre des rubriques d'experts
Métrique d'évaluationStandard 'all-pass' (tâche réussie uniquement si tous les critères passent) ; 75 000+ critères de rubrique rédigés par des experts
AccèsPublic
LanguesAnglais
Taille du jeu1 200+ tâches, 24 domaines de pratique juridique, 75 000+ critères de rubrique
Année de publication2026
RessourcesSite / dépôt officiel

Classement des modèles (12)

#ModèleÉditeurLicenceScoreSortieFiabilité
1Claude Fable 5Anthropic🔒 Propriétaire13,3 %9 juin 2026Auto-déclaré
2Claude Opus 4.7Anthropic🔒 Propriétaire7,1 %16 avril 2026n.d.
3Claude Sonnet 5Anthropic🔒 Propriétaire5,8 %30 juin 2026Auto-déclaré
4Claude Sonnet 4.6Anthropic🔒 Propriétaire5,4 %17 février 2026n.d.
5Claude Opus 4.6Anthropic🔒 Propriétaire4,2 %5 février 2026n.d.
6GPT-5.5OpenAI🔒 Propriétaire2,1 %23 avril 2026n.d.
7Gemini 3.5 FlashGoogle🔒 Propriétaire0,8 %19 mai 2026n.d.
8GPT-4.5OpenAI🔒 Propriétaire0,4 %5 mars 2026n.d.
9GPT-5.4 miniOpenAI🔒 Propriétaire0,0 %17 mars 2026n.d.
10Gemini 3 FlashGoogle🔒 Propriétaire0,0 %17 décembre 2025n.d.
11Gemini 3.1 Flash-LiteGoogle🔒 Propriétaire0,0 %3 mars 2026n.d.
12Gemini 3.1 Pro PreviewGoogle▫ n.d.0,0 %19 février 2026n.d.

Classement établi sur 12 modèles évalués, dont 12 de grands éditeurs. Score médian de l'ensemble : 1,5 %. « Auto-déclaré » : score communiqué par l'éditeur, non rejoué indépendamment. « Mesuré » : évalué par un tiers (Epoch AI, LiveBench, MTEB…).

Notre analyse

Un score élevé indique qu’un agent satisfait intégralement les exigences des tâches réussies. Le standard « all-pass » est particulièrement strict : l’échec d’un seul critère de rubrique suffit à faire échouer la tâche entière. Cette méthode valorise donc la complétude et la fiabilité du livrable plutôt qu’une réussite partielle. La lecture des résultats appelle néanmoins une distinction entre la rigueur du protocole et la provenance des scores, ceux de la base étant majoritairement auto-déclarés par les éditeurs.

Le classement montre une difficulté élevée pour les modèles évalués. Avec une médiane de 1 % et un meilleur résultat de 13 % pour Claude Fable 5, il ne présente pas de signe de saturation. Sa portée reste centrée sur le travail juridique en anglais et sur les domaines de pratique couverts. Son accès public doit aussi être pris en compte dans l’interprétation à long terme, notamment face au risque de contamination des évaluations. Les écarts observés reflètent avant tout la capacité à produire des livrables juridiques complets sous des contraintes cumulatives.


Sources des scores : llm-stats.