>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
Python

Cómo probar agentes de IA legal en casos del mundo real con Harvey LAB

Los benchmarks estándar como MMLU o HumanEval hacen un gran trabajo mostrando si un modelo puede escribir código básico o responder preguntas de prueba. Pero intenta asignar tal modelo para analizar una carpeta de contratos para una operación de fusión y adquisición. De repente, las pruebas de propósito general no reflejan la complejidad real del dominio. Los documentos pueden abarcar cientos de páginas, y un solo error en una cláusula contractual puede costarle a una empresa millones de dólares.

Harvey ha publicado el repositorio Harvey LAB como código abierto. Es un framework y dataset de prueba para evaluar agentes de IA en tareas legales reales.

Harvey LAB

Qué hay dentro del repositorio

El repositorio contiene dos componentes principales: un dataset abierto de tareas legales y un entorno de ejecución para ejecutar agentes.

Los datos abarcan más de dos docenas de áreas de práctica legal. El dataset contiene 16.671 tareas, y estas no son solo prompts de texto—son escenarios completos. Cada tarea incluye documentos fuente, instrucciones para el agente y criterios de evaluación.

El código está escrito en Python y publicado bajo la licencia MIT. En el momento de esta revisión, el proyecto tiene alrededor de 666 estrellas en GitHub, pero está siendo desarrollado activamente.

Cómo funciona la arquitectura

Las pruebas giran en torno a un ciclo único. Primero, el entorno de prueba carga la tarea y pasa los documentos al agente. Luego, el agente realiza acciones, llama a herramientas y genera una respuesta final. Al final, el sistema ejecuta algoritmos de evaluación.

Todo el sistema está dividido en varios componentes:

  • Modelo de tarea que almacena archivos, instrucciones de texto, contexto y rúbricas de evaluación.
  • Entorno de ejecución que ejecuta agentes en un entorno aislado, intercepta llamadas a herramientas, cuenta tokens y registra acciones.
  • Adaptadores para conectar diferentes modelos y frameworks de agentes.
  • Módulo de informes que recopila métricas y construye dashboards comparativos para las ejecuciones.

Cómo funciona la evaluación

El trabajo legal es específico. Aquí, es raro que el 80% de una respuesta correcta se considere aprobado si el 20% restante contiene información distorsionada sobre sanciones.

Harvey LAB utiliza el enfoque de rúbrica de aprobación total. Una respuesta solo se aprueba cuando el agente ha cumplido absolutamente todas las condiciones obligatorias de la rúbrica de evaluación. Si se pierde incluso un detalle, toda la tarea se considera fallida.

Para evaluaciones de texto complejas, se utiliza un juez LLM. Los autores incorporaron reglas que reducen el sesgo del juez y lo obligan a seguir estrictamente los criterios dados en lugar de evaluar el estilo de escritura.

Ejemplo práctico con auditoría de M&A

La documentación del proyecto incluye una guía paso a paso utilizando el ejemplo de una auditoría de una sala de datos virtual para una operación de M&A.

El escenario parece realista. El agente recibe un paquete de documentos corporativos, contratos de arrendamiento y contratos con clientes. Su tarea es identificar riesgos de cambio de control, inconsistencias en los términos contractuales y obligaciones ocultas.

Primero, ejecutas el comando de inspección de tareas para ver los archivos y las reglas de evaluación. Luego, el propio agente se ejecuta, obteniendo acceso a herramientas de lectura y búsqueda de documentos. Una vez completado el trabajo, el framework compara las conclusiones del agente con la rúbrica de referencia y produce un informe detallado. El resultado es un dashboard con desgloses que muestran si el modelo maneja la búsqueda de condiciones legales complejas.

Para quién es el proyecto

Si estás construyendo un sistema RAG o un servicio de agentes para abogados, este repositorio te ahorra tener que crear pruebas sintéticas. Obtienes un conjunto listo para usar de casos reales que inmediatamente muestran dónde el modelo alucina y dónde realmente entiende el contexto.

El proyecto también es útil para quienes exploran el comportamiento de LLM en dominios estrechos. Es conveniente para probar diferentes estrategias de prompting, métodos de fragmentación de documentos y enfoques de llamadas a herramientas.

Las desventajas incluyen la novedad del proyecto. Parte de la documentación aún se está completando, y ejecutar las 16.671 tareas requiere un presupuesto considerable de API para modelos frontier. Para depuración, es más práctico ejecutar subconjuntos individuales de pruebas.

Si quieres probarlo, comienza con la guía en docs/tutorial.md. Te guía a través de todo el proceso, desde la configuración del entorno hasta el análisis del dashboard final.

Proyectos relacionados