如何使用 Harvey LAB 在真实案例上测试法律 AI 代理
MMLU 或 HumanEval 等标准基准测试在展示模型是否能编写基础代码或回答测试问题方面表现出色。但如果让这样的模型去分析并购交易的合同文件夹,你就会发现通用测试无法反映该领域的真实复杂性。文档可能长达数百页,而一个合同条款的错误就可能导致公司损失数百万美元。
Harvey 已将 Harvey LAB 代码库开源。这是一个用于在真实法律任务上评估 AI 代理的框架和测试数据集。

仓库内容概览
该代码库包含两个主要组件:一个法律任务的开源数据集和一个用于运行代理的执行环境。
数据涵盖二十多个法律实践领域。数据集包含 16,671 个任务,这些不仅仅是文本提示——而是完整的场景。每个任务都包含源文档、代理指令和评估标准。
代码使用 Python 编写,采用 MIT 许可证发布。在本次评审时,该项目在 GitHub 上约有 666 颗星,但仍在积极开发中。
架构工作原理
测试围绕一个循环进行。首先,测试环境加载任务并将文档传递给代理。然后代理执行操作、调用工具并生成最终响应。最后,系统运行评估算法。
整个系统分为几个组件:
- 任务模型,存储文件、文本指令、上下文和评估标准。
- 执行环境,在隔离环境中运行代理、拦截工具调用、计算 token 并记录操作。
- 适配器,用于连接不同的模型和代理框架。
- 报告模块,收集指标并为运行构建比较仪表板。
评估机制
法律工作有其特殊性。在这一领域,如果剩余 20% 包含关于处罚制裁的扭曲信息,那么 80% 正确的答案几乎不可能被认为是及格。
Harvey LAB 采用全通过评分标准方法。只有当代理完全满足评估标准中的所有强制条件时,响应才算通过。如果遗漏了哪怕一个细节,整个任务就被视为失败。
对于复杂的文本评估,使用 LLM 评判器。作者内置了减少评判偏差的规则,强制其严格遵循给定标准而非评价写作风格。
并购审计实践示例
项目文档包含一个使用虚拟数据室并购审计的逐步指南。
该场景看起来很真实。代理收到一揽子公司文档、租赁协议和客户合同。其任务是识别控制权变更风险、合同条款不一致和隐藏义务。
首先,运行任务检查命令以查看文件和评估规则。然后代理本身运行,获得文档阅读和搜索工具的访问权限。工作完成后,框架将代理的结论与参考标准进行比较,并生成详细报告。输出是一个仪表板,显示模型在搜索复杂法律条件方面的表现。
适用人群
如果你正在为律师构建 RAG 系统或代理服务,此代码库可以让你无需创建合成测试。你获得了一套现成的真实案例,能立即展示模型在哪里产生幻觉、哪里真正理解了上下文。
该项目对于探索 LLM 在窄领域行为的人也很有用。它便于测试不同的提示策略、文档分块方法和工具调用方法。
缺点包括项目的新颖性。一些文档仍在完善中,运行全部 16,671 个任务需要为前沿模型投入大量 API 预算。对于调试,运行单个测试子集更为实用。
如果你想尝试,请从 docs/tutorial.md 的指南开始。它将带你完成从环境设置到分析最终仪表板的整个过程。
相关项目