Come Testare Agenti AI Legali su Casi Reali con Harvey LAB
I benchmark standard come MMLU o HumanEval sono ottimi per mostrare se un modello sa scrivere codice base o rispondere a domande di test. Ma provate ad assegnare a un tale modello l'analisi di una cartella di contratti per un'operazione di fusione e acquisizione. Improvvisamente, i test general-purpose non riflettono la complessità reale del dominio. I documenti possono estendersi per centinaia di pagine, e un singolo errore in una clausola contrattuale può costare a un'azienda milioni di dollari.
Harvey ha rilasciato il repository Harvey LAB come open source. È un framework e dataset di test per valutare agenti AI su compiti legali reali.

Cosa Contiene il Repository
Il repository contiene due componenti principali: un dataset aperto di compiti legali e un ambiente di execution per lanciare agenti.
I dati coprono oltre due dozzine di aree di pratica legale. Il dataset contiene 16.671 compiti, e non sono semplici prompt testuali—sono scenari completi. Ogni compito include documenti sorgente, istruzioni per l'agente e criteri di valutazione.
Il codice è scritto in Python e rilasciato sotto licenza MIT. Al momento di questa revisione, il progetto ha circa 666 stelle su GitHub, ma è in fase di sviluppo attivo.
Come Funziona l'Architettura
I test ruotano attorno a un singolo ciclo. Prima, l'ambiente di test carica il compito e passa i documenti all'agente. Poi l'agente compie azioni, chiama strumenti e genera una risposta finale. Alla fine, il sistema esegue gli algoritmi di valutazione.
L'intero sistema è suddiviso in diversi componenti:
- Modello di compito che memorizza file, istruzioni testuali, contesto e rubriche di valutazione.
- Ambiente di execution che lancia agenti in un setting isolato, intercetta chiamate a strumenti, conta i token e registra le azioni.
- Adapter per connettere diversi modelli e framework di agenti.
- Modulo di reporting che raccoglie metriche e costruisce dashboard comparative per le run.
Come Funziona la Valutazione
Il lavoro legale è specifico. Qui, è raro che l'80% di una risposta corretta sia considerato sufficiente se il restante 20% contiene informazioni distorte su sanzioni penali.
Harvey LAB utilizza l'approccio All-Pass Rubric. Una risposta passa solo quando l'agente ha soddisfatto assolutamente tutte le condizioni obbligatorie dalla rubrica di valutazione. Se anche un singolo dettaglio viene tralasciato, l'intero compito è considerato fallito.
Per valutazioni complesse di testo, viene utilizzato un LLM judge. Gli autori hanno introdotto regole che riducono il bias del judge e lo obbligano a seguire rigorosamente i criteri forniti piuttosto che valutare lo stile di scrittura.
Esempio Pratico con Audit M&A
La documentazione del progetto include una guida passo-passo che utilizza l'esempio di un audit di una virtual data room per un'operazione M&A.
Lo scenario appare realistico. L'agente riceve un pacchetto di documenti aziendali, contratti di locazione e contratti con i clienti. Il suo compito è identificare rischi di change of control, incongruenze nei termini contrattuali e obbligazioni nascoste.
Prima, si esegue il comando di ispezione del compito per visualizzare i file e le regole di valutazione. Poi l'agente stesso viene lanciato, ottenendo accesso a strumenti di lettura e ricerca dei documenti. Dopo il completamento del lavoro, il framework confronta le conclusioni dell'agente con la rubrica di riferimento e produce un report dettagliato. L'output è una dashboard con suddivisioni che mostrano se il modello gestisce la ricerca di condizioni legali complesse.
A Chi Serve il Progetto
Se stai costruendo un sistema RAG o un servizio di agenti per avvocati, questo repository ti risparmia la creazione di test sintetici. Ottieni un set pronto di casi reali che mostrano immediatamente dove il modello allucina e dove comprende davvero il contesto.
Il progetto è utile anche per chi esplora il comportamento degli LLM in domini ristretti. È comodo per testare diverse strategie di prompting, metodi di chunking dei documenti e approcci di tool-calling.
Gli svantaggi includono la novità del progetto. Alcuna documentazione è ancora in fase di completamento, e l'esecuzione di tutti i 16.671 compiti richiede un budget API sostanzioso per i modelli frontier. Per il debugging, è più pratico lanciare sottoinsiemi di test individuali.
Se vuoi provarlo, inizia con la guida su docs/tutorial.md. Illustra l'intero processo dalla configurazione dell'ambiente all'analisi della dashboard finale.
Progetti correlati