Hoe test je juridische AI-agents op echte zaken met Harvey LAB
Standaard benchmarks zoals MMLU of HumanEval doen het prima om te laten zien of een model basiscode kan schrijven of testvragen kan beantwoorden. Maar wijs zo'n model maar eens toe aan het analyseren van een map met contracten voor een fusie- en overnametransactie. Plotseling weerspiegelen algemene tests niet langer de werkelijke complexiteit van het domein. Documenten kunnen honderden pagina's beslaan, en een enkele fout in een contractuele bepaling kan een bedrijf miljoenen dollars kosten.
Harvey heeft de Harvey LAB-repository als open source vrijgegeven. Het is een framework en testdataset voor het evalueren van AI-agents op echte juridische taken.

Wat zit er in de Repository
De repository bevat twee hoofdcomponenten: een open dataset van juridische taken en een uitvoeringsomgeving voor het draaien van agents.
De data bestrijkt meer dan twee dozijn juridische praktijkgebieden. De dataset bevat 16.671 taken, en dit zijn niet zomaar tekstprompts—het zijn volwaardige scenario's. Elke taak bevat brondocumenten, agent-instructies en evaluatiecriteria.
De code is geschreven in Python en vrijgegeven onder de MIT-licentie. Ten tijde van deze review heeft het project ongeveer 666 sterren op GitHub, maar het wordt actief ontwikkeld.
Hoe de Architectuur Werkt
Testen draait om één cyclus. Eerst laadt de testomgeving de taak en geeft documenten door aan de agent. Vervolgens voert de agent acties uit, roept tools aan en genereert een definitieve reactie. Aan het einde voert het systeem evaluatie-algoritmen uit.
Het hele systeem is opgedeeld in verschillende componenten:
- Taakmodel dat bestanden, tekstinstructies, context en evaluatierubrics opslaat.
- Uitvoeringsomgeving die agents draait in een geïsoleerde setting, tool-aanroepen onderschept, tokens telt en acties logt.
- Adapters voor het verbinden van verschillende modellen en agent-frameworks.
- Rapportagemodule die metrieken verzamelt en vergelijkende dashboards bouwt voor runs.
Hoe Evaluatie Werkt
Juridisch werk is specifiek. Hier is het zeldzaam dat 80% van een correct antwoord wordt beschouwd als geslaagd als de resterende 20% vertekende informatie bevat over boetesancties.
Harvey LAB gebruikt de All-Pass Rubric-benadering. Een reactie slaagt alleen wanneer de agent absoluut alle verplichte voorwaarden uit de evaluatierubric heeft vervuld. Als zelfs maar één detail wordt gemist, wordt de hele taak als mislukt beschouwd.
Voor complexe tekstevaluaties wordt een LLM-judge gebruikt. De auteurs hebben regels ingebouwd die judge-bias verminderen en het dwingen om strikt de gegeven criteria te volgen in plaats van schrijfstijl te evalueren.
Praktisch Voorbeeld met M&A Audit
De projectdocumentatie bevat een stapsgewijze handleiding met het voorbeeld van een virtueel dataroom-audit voor een M&A-deal.
Het scenario ziet er realistisch uit. De agent ontvangt een pakket aan bedrijfsdocumenten, huurovereenkomsten en klantcontracten. Zijn taak is het identificeren van change of control-risico's, inconsistenties in contracttermen en verborgen verplichtingen.
Eerst voer je het taakinspectiecommando uit om de bestanden en evaluatieregels te bekijken. Vervolgens draait de agent zelf, met toegang tot documentlezen en zoektools. Nadat het werk is voltooid, vergelijkt het framework de conclusies van de agent met de referentierubric en produceert een gedetailleerd rapport. De output is een dashboard met uitsplitsingen die laten zien of het model het zoeken naar complexe juridische voorwaarden aankan.
Waarvoor is het Project Bedoeld
Als je een RAG-systeem of agentdienst voor juristen bouwt, bespaart deze repository je het maken van synthetische tests. Je krijgt een kant-en-klare set echte zaken die onmiddellijk laten zien waar het model hallucineert en waar het de context werkelijk begrijpt.
Het project is ook nuttig voor degenen die LLM-gedrag in smalle domeinen verkennen. Het is handig voor het testen van verschillende prompting-strategieën, document-chunking-methoden en tool-calling-benaderingen.
De nadelen zijn de nieuwheid van het project. Sommige documentatie wordt nog voltooid, en het draaien van alle 16.671 taken vereist een aanzienlijk API-budget voor frontier-modellen. Voor debugging is het praktischer om individuele testsubsets te draaien.
Als je het wilt uitproberen, begin dan met de handleiding op docs/tutorial.md. Deze doorloopt het hele proces van omgevingssetup tot het analyseren van het uiteindelijke dashboard.
Gerelateerde projecten