Comment tester des agents IA juridiques sur des cas réels avec Harvey LAB
Les benchmarks standards comme MMLU ou HumanEval font un excellent travail pour montrer si un modèle peut écrire du code basique ou répondre à des questions de test. Mais essayez d'assigner un tel modèle pour analyser un dossier de contrats dans le cadre d'une opération de fusion-acquisition. Soudain, les tests généralistes ne reflètent plus la complexité réelle du domaine. Les documents peuvent s'étendre sur des centaines de pages, et une seule erreur de clause contractuelle peut coûter des millions d'euros à une entreprise.
Harvey a publié le dépôt Harvey LAB en open source. C'est un framework et un dataset de test pour évaluer des agents IA sur des tâches juridiques réelles.

Ce que contient le dépôt
Le dépôt contient deux composants principaux : un dataset ouvert de tâches juridiques et un environnement d'exécution pour faire tourner les agents.
Les données couvrent plus de deux dizaines de domaines de pratique juridique. Le dataset contient 16 671 tâches, et ce ne sont pas de simples prompts textuels — ce sont des scénarios complets. Chaque tâche inclut des documents sources, des instructions pour l'agent et des critères d'évaluation.
Le code est écrit en Python et publié sous licence MIT. Au moment de cette revue, le projet compte environ 666 étoiles sur GitHub, mais il est activement développé.
Comment fonctionne l'architecture
Les tests tournent autour d'un cycle unique. D'abord, l'environnement de test charge la tâche et transmet les documents à l'agent. Ensuite, l'agent effectue des actions, appelle des outils et génère une réponse finale. À la fin, le système exécute les algorithmes d'évaluation.
L'ensemble du système est divisé en plusieurs composants :
- Modèle de tâche qui stocke les fichiers, les instructions textuelles, le contexte et les grilles d'évaluation.
- Environnement d'exécution qui fait tourner les agents dans un cadre isolé, intercepte les appels d'outils, compte les jetons et journalise les actions.
- Adaptateurs pour connecter différents modèles et frameworks d'agents.
- Module de reporting qui collecte les métriques et construit des tableaux de bord comparatifs pour les exécutions.
Comment fonctionne l'évaluation
Le travail juridique est spécifique. Ici, il est rare qu'une réponse correcte à 80 % soit considérée comme suffisante si les 20 % restants contiennent des informations déformées sur des sanctions pénales.
Harvey LAB utilise l'approche All-Pass Rubric. Une réponse n'est validée que lorsque l'agent a rempli absolument toutes les conditions obligatoires de la grille d'évaluation. Si un seul détail est oublié, la tâche entière est considérée comme échouée.
Pour les évaluations de texte complexes, un juge LLM est utilisé. Les auteurs ont intégré des règles qui réduisent les biais du juge et l'obligent à suivre strictement les critères donnés plutôt que d'évaluer le style d'écriture.
Exemple pratique avec un audit de fusion-acquisition
La documentation du projet inclut un guide pas à pas utilisant l'exemple d'un audit de data room virtuelle pour une opération de fusion-acquisition.
Le scénario semble réaliste. L'agent reçoit un ensemble de documents corporate, des contrats de bail et des contrats clients. Sa tâche est d'identifier les risques de changement de contrôle, les incohérences dans les termes des contrats et les obligations cachées.
D'abord, vous exécutez la commande d'inspection de tâche pour voir les fichiers et les règles d'évaluation. Ensuite, l'agent s'exécute lui-même, avec accès aux outils de lecture et de recherche de documents. Une fois le travail terminé, le framework compare les conclusions de l'agent avec la grille de référence et produit un rapport détaillé. La sortie est un tableau de bord avec des ventilations montrant si le modèle gère la recherche de conditions juridiques complexes.
À qui s'adresse le projet
Si vous construisez un système RAG ou un service d'agents pour des avocats, ce dépôt vous évite d'avoir à créer des tests synthétiques. Vous obtenez un ensemble prêt à l'emploi de cas réels qui montrent immédiatement où le modèle a des hallucinations et où il comprend vraiment le contexte.
Le projet est également utile pour ceux qui explorent le comportement des LLM dans des domaines étroits. C'est pratique pour tester différentes stratégies de prompting, les méthodes de chunking de documents et les approches d'appel d'outils.
Les inconvénients incluent la nouveauté du projet. Certaines documentations sont encore en cours de rédaction, et exécuter les 16 671 tâches nécessite un budget API substantiel pour les modèles de pointe. Pour le débogage, il est plus pratique d'exécuter des sous-ensembles de tests individuels.
Si vous voulez l'essayer, commencez par le guide à docs/tutorial.md. Il parcourt l'ensemble du processus, de la configuration de l'environnement à l'analyse du tableau de bord final.
Projets similaires