10分钟速览Harvey LAB:开源法律智能体基准全貌
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
Harvey LAB(Legal Agent Benchmark,法律智能体基准)是 Harvey AI 开源的法律 AI 评测项目,专门用于评估 LLM 智能体完成真实法律工作的能力。它包含两大件:1,660 个覆盖 24 个法律实务领域的任务数据集,以及一套可运行的执行与评估框架(harness)——给智能体一份"案卷",让它产出法律文书,再由 LLM 评委按评分细则逐条打分。无论你是 AI 工程师、法律科技从业者,还是好奇"大模型能当律师吗"的普通读者,这篇 10 分钟速览都能帮你快速建立全局认知。
🧭 Harvey LAB 是什么:任务数据集 + 执行框架
很多人第一次接触基准测试(benchmark)会觉得抽象。Harvey LAB 的思路其实非常直白:
- 任务(Task):每个任务 = 一份合成生成的模拟案卷(合同、邮件、表格、备忘录等真实格式文件)+ 一段律师风格的工作指令 + 一份逐条可打分的评分细则(rubric)。
- 运行(Run):智能体在沙箱里读取案卷、调用工具、写出交付物(如 Word 备忘录)。
- 评估(Evaluate)+ 报告(Report):LLM 评委逐条判 pass/fail,生成 HTML 报告和跨模型对比看板。
整个系统是"文件系统优先"的设计——没有数据库、没有 Web 服务:任务在 tasks/ 目录,运行结果在results/,报告是静态 HTML,对本地运行和复现非常友好。
📚 任务库一览:1,660 个任务横跨 24 个法律领域
据 docs/eval-strategies.md 的统计,基准目前包含约101,000 条评分细则,最大的几个领域:
| 法律领域 | 任务数 |
|---|---|
| 公司并购(Corporate M&A) | 156 |
| 知识产权(IP) | 147 |
| 私募与风险投资 | 99 |
| 公司治理与合规 | 97 |
| 信托、遗产与私人客户 | 77 |
| 诉讼与争议解决 | 52 |
任务 ID 直接镜像目录路径。例如corporate-ma/review-data-room-red-flag-review这个并购尽调任务,就包含60 份案卷文件(Word、Excel、邮件、PPT 混合)和68 条评分细则——要求智能体找出 EBITDA 数据矛盾、未过户的许可证等真实感十足的"红旗"。想亲手翻看一个任务的完整定义,可以看它的 task.json。
⚙️ 智能体如何干活:6 个工具 + 安全沙箱
运行入口是harness/run.py,核心循环在 harness/agent_loop.py。智能体被放入每任务独立的 Podman 沙箱(断网、去权限),所有文件操作都走同一个受控接口,即使案卷里藏着恶意文件也不会影响宿主机——威胁模型详见 sandbox/README.md。
智能体只有 6 个"闭域"工具,模拟了律师处理案卷的全部基本动作:
| 工具 | 用途 |
|---|---|
bash | 在工作区内执行 shell 命令 |
read | 读取 .docx / .xlsx / .pptx / .pdf 及文本 |
write/edit | 编写和修改交付物 |
glob/grep | 按模式找文件、按正则搜内容 |
此外,harness/adapters/ 提供多模型适配层,支持Anthropic(Claude)、OpenAI(GPT)、Google(Gemini)、Mistral、Fireworks五类供应商;harness/skills/ 里还有 docx/pptx/xlsx 技能手册,教智能体如何规范地读写办公文档。
🧪 评分方法:为什么"全通过"才是硬指标
这是 Harvey LAB 最值得普通读者理解的设计(方法论全文见 docs/eval-strategies.md):
- 没有标准答案文件。每条细则的
match_criteria文本本身就是评判标准,由 LLM 评委(默认 Claude Sonnet)做语义匹配——换个说法但抓住了实质,同样算通过。 - 任务级分数是二元的:所有细则全过才得 1.0 分,否则 0.0 分。官方解释很犀利:尽职调查报告漏掉一个重大问题,哪怕抓对了其余 95%,对委托人也等于没用。
- 作为诊断辅助,报告同时给出"细则通过率",让你看清模型是差 1 条还是差 10 条。
- 可选双评委模式(
--dual):Claude Sonnet 4.6 + GPT-5.5 独立打分,进一步降低单评委偏差。评委提示词模板在 evaluation/prompts/rubric_criterion.txt,评分逻辑在 evaluation/scoring.py。
🚀 10 分钟上手:四步跑通一个法律任务
官方完整教程在 docs/tutorial.md(含从环境配置到对比看板的全部 12 步),核心路径只需四步:
第 1 步 · 克隆并初始化(地址:https://gitcode.com/GitHub_Trending/ha/harvey-labs )
git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs && ./scripts/setup.sh第 2 步 · 配置密钥:把ANTHROPIC_API_KEY(评委必需)写入根目录.env文件即可;想测 GPT/Gemini 再按需加OPENAI_API_KEY/GOOGLE_API_KEY。
第 3 步 · 看看任务长什么样:
uv run python -m utils.list_tasks --area corporate-ma uv run python -m utils.describe_task corporate-ma/review-data-room-red-flag-reviewutils/list_tasks.py 支持按领域、工作类型(分析/起草/审查/调研)、难度筛选;utils/describe_task.py 会打印任务的交付物、文档数和细则清单。
第 4 步 · 运行 → 评分 → 看报告:
uv run python -m harness.run --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-review uv run python -m evaluation.run_eval --run-id <run-id> \ --task corporate-ma/review-data-room-red-flag-review完成后打开results/<run-id>/report.html,就能看到全通过状态、逐条评委推理、文档覆盖率(比如 60 份案卷读了 31 份)和 Token 消耗——这通常是"模型到底哪里没做好"的最快入口。
📊 对比多个模型:sweep 批量跑 + 对比看板
单个任务跑通后,utils/sweep.py 可以一次性跑"模型 × 任务"矩阵(建议先加--dry-run预览计划),自动完成运行、评估、报告三个阶段,还支持--parallel并行。最后用 evaluation/compare.py 生成对比看板,汇总指标包括:
- All-pass 率(头条指标)
- 细则通过率(诊断指标)
- 逐条细则热力图、文档覆盖率、Token / 耗时 / 估算成本
想换 Gemini 跑同一任务?只需把--model换成google/gemini-3.1-pro-preview;想加推理深度?追加--reasoning-effort high。每个模型适配器都在 harness/adapters/ 下,想接新供应商也只需实现一个ModelAdapter接口。
📖 进阶阅读与文档索引
| 文档 | 内容 |
|---|---|
| docs/tutorial.md | 端到端完整教程:环境、任务、运行、评分、报告、对比 |
| docs/architecture.md | 任务模型、harness、工具、沙箱、适配器、报告架构 |
| docs/eval-strategies.md | 全通过评分与 LLM 评委行为详解 |
| CONTRIBUTING.md | 如何新增任务、模型适配与评测改进 |
💡 小贴士:基准中的案卷文件均为大批量合成生成、并经人类律师指导审阅,实质复杂度贴近真实法律工作,但毕竟不是执业律师从零起草的文档——引用时请留意这一点。
一句话总结:Harvey LAB 把"法律工作能不能交给 AI"这个大问题,拆成了 1,660 个可量化、可复现、可对比的小实验——这正是它成为法律 AI 领域重要开源基准的原因。🏛️
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考