>_ DevTrendspt

Idioma

Início

Linguagens

Seções

Frontend Backend Mobile DevOps AI / ML GameDev Blockchain Embarcados Segurança
Python

Como Testar Agentes de IA Jurídica em Casos Reais com Harvey LAB

Benchmarks padrão como MMLU ou HumanEval fazem um ótimo trabalho ao mostrar se um modelo consegue escrever código básico ou responder perguntas de teste. Mas tente atribuir tal modelo para analisar uma pasta de contratos para uma operação de fusão e aquisição. De repente, testes de propósito geral não refletem a complexidade real do domínio. Documentos podem ter centenas de páginas, e um único erro em uma cláusula contratual pode custar milhões de dólares a uma empresa.

A Harvey lançou o repositório Harvey LAB como código aberto. É um framework e dataset de teste para avaliar agentes de IA em tarefas jurídicas reais.

Harvey LAB

O Que Está Dentro do Repositório

O repositório contém dois componentes principais: um dataset aberto de tarefas jurídicas e um ambiente de execução para rodar agentes.

Os dados abrangem mais de duas dezenas de áreas de prática jurídica. O dataset contém 16.671 tarefas, e estas não são apenas prompts de texto—são cenários completos. Cada tarefa inclui documentos de origem, instruções para o agente e critérios de avaliação.

O código é escrito em Python e distribuído sob a licença MIT. No momento desta análise, o projeto tem cerca de 666 estrelas no GitHub, mas está em desenvolvimento ativo.

Como a Arquitetura Funciona

O teste gira em torno de um único ciclo. Primeiro, o ambiente de teste carrega a tarefa e passa os documentos ao agente. Então o agente executa ações, chama ferramentas e gera uma resposta final. No final, o sistema executa algoritmos de avaliação.

Todo o sistema é dividido em vários componentes:

  • Modelo de tarefa que armazena arquivos, instruções de texto, contexto e rubricas de avaliação.
  • Ambiente de execução que roda agentes em um ambiente isolado, intercepta chamadas de ferramentas, conta tokens e registra ações.
  • Adaptadores para conectar diferentes modelos e frameworks de agentes.
  • Módulo de relatórios que coleta métricas e constrói dashboards comparativos para as execuções.

Como a Avaliação Funciona

O trabalho jurídico é específico. Aqui, é raro que 80% de uma resposta correta seja considerada válida se os 20% restantes contêm informações distorcidas sobre sanções penais.

O Harvey LAB usa a abordagem All-Pass Rubric. Uma resposta só passa quando o agente cumpriu absolutamente todas as condições obrigatórias da rubrica de avaliação. Se até um único detalhe for perdido, toda a tarefa é considerada reprovada.

Para avaliações complexas de texto, é usado um judge LLM. Os autores construíram regras que reduzem o viés do judge e o forçam a seguir rigorosamente os critérios fornecidos, em vez de avaliar o estilo de escrita.

Exemplo Prático com Auditoria de M&A

A documentação do projeto inclui um guia passo a passo usando o exemplo de uma auditoria de data room virtual para uma operação de M&A.

O cenário parece realista. O agente recebe um pacote de documentos corporativos, contratos de locação e contratos com clientes. Sua tarefa é identificar riscos de mudança de controle, inconsistências nos termos contratuais e obrigações ocultas.

Primeiro, você executa o comando de inspeção da tarefa para visualizar os arquivos e regras de avaliação. Então o próprio agente é executado, ganhando acesso a ferramentas de leitura e busca de documentos. Após a conclusão do trabalho, o framework compara as conclusões do agente com a rubrica de referência e produz um relatório detalhado. A saída é um dashboard com análises mostrando se o modelo lida bem com a busca por condições jurídicas complexas.

Para Quem o Projeto É Indicado

Se você está construindo um sistema RAG ou serviço de agentes para advogados, este repositório evita que você precise criar testes sintéticos. Você obtém um conjunto pronto de casos reais que mostram imediatamente onde o modelo alucina e onde realmente entende o contexto.

O projeto também é útil para quem está explorando o comportamento de LLMs em domínios específicos. É conveniente para testar diferentes estratégias de prompting, métodos de fragmentação de documentos e abordagens de chamada de ferramentas.

As desvantagens incluem a novidade do projeto. Parte da documentação ainda está sendo concluída, e executar todas as 16.671 tarefas requer um orçamento substancial de API para modelos frontier. Para debug, é mais prático executar subconjuntos individuais de testes.

Se você quiser experimentar, comece com o guia em docs/tutorial.md. Ele percorre todo o processo desde a configuração do ambiente até a análise do dashboard final.

Projetos relacionados