Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
Harvey LAB(Legal Agent Benchmark)是 Harvey AI 开源的法律智能体基准测试平台,内含 1,600+ 个真实感法律任务,用于评测大模型 Agent 完成法律工作的能力。本文是一份面向新手的完整部署教程,带你用一条脚本完成 Linux、macOS、Windows 三大平台的环境搭建,从克隆仓库到跑通第一个法律评测任务,全程约 10 分钟。
一、Harvey LAB 是什么?部署后能得到什么 🧭
Harvey LAB 由两部分组成:
| 组成 | 说明 | 所在位置 |
|---|---|---|
| 任务数据集 | 1,660 个任务,覆盖 24 个法律实践领域,含合成案卷文档与评分标准(rubric) | tasks/ |
| 执行测试台(harness) | 驱动 Agent 在沙箱容器中读写文档、执行命令,并由 LLM 裁判打分生成报告 | harness/ |
部署完成后,你可以:
- ✅ 让任意大模型(Claude / GPT / Gemini)完成真实感法律任务,如审阅数据室、起草并购协议
- ✅ 用 LLM-as-Judge 对产出逐条评分,生成可视化 HTML 报告
- ✅ 用 sweep 工具批量对比多个模型在同一任务上的表现
📖 官方教程入口:docs/tutorial.md
二、部署前准备:3 项前置检查清单 📋
在跑安装脚本前,确认以下三项:
| 检查项 | 要求 | 备注 |
|---|---|---|
| Python 版本 | 3.12 或 3.13(<3.14) | 由uv自动管理,无需手动装 |
| 操作系统 | Linux / macOS /Windows 11 | Windows 需在 BIOS 中开启 CPU 虚拟化,脚本会自动引导安装 WSL2 |
| 模型 API 密钥 | Anthropic 密钥必需(用作评分裁判);OpenAI / Google 密钥可选 | 详见下文 |
💡 macOS 用户建议先装好 Homebrew;Linux 用户需有
apt与sudo权限(脚本会自动处理)。
依赖声明见 pyproject.toml,容器镜像见 sandbox/Dockerfile。
三、一键安装:3 步完成跨平台部署 🚀
1. 克隆仓库
git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs2. 运行一键安装脚本
./scripts/setup.sh这个幂等脚本(可重复执行、自动跳过已完成步骤)会按顺序完成6 个步骤,覆盖全部三大平台:
- 安装
uv(Python 包管理器) uv sync同步 Python 依赖- 安装
pandoc(docx 文档解析器) - 安装
podman(每个任务的沙箱容器运行时,rootless 免 GUI) - 初始化并启动
podman machine(macOS / Windows 专属虚拟机) - 拉取沙箱镜像
lab-sandbox:latest(失败时自动本地构建)
3. Windows 用户特别注意 ⚠️
首次运行会在检测硬件条件后安装 WSL2 并提示重启——重启后重新执行./scripts/setup.sh,脚本会自动从断点继续。整个过程完全在 git-bash 中完成,无需手动配置。
脚本详细逻辑见 scripts/setup.sh。
四、配置模型 API 密钥 🔑
在仓库根目录创建.env文件(已在.gitignore中,不会被提交),每行一条密钥:
ANTHROPIC_API_KEY=你的密钥 OPENAI_API_KEY=你的密钥 # 可选 GOOGLE_API_KEY=你的密钥 # 可选- Anthropic 密钥必需:默认 LLM 裁判用它给 Agent 的产出打分
- OpenAI / Google 密钥可选,仅当你要评测对应模型时配置
- 测试台每次运行会自动加载
.env,只需配置一次
模型适配器源码位于 harness/adapters/,支持 anthropic、openai、google、mistral、fireworks 等提供商。
五、首次运行验证:跑一个真实法律任务 ✨
环境就绪后,用这条命令验证部署是否成功——让 Agent 完成一个并购数据室红旗审查任务(含 60 份案卷文档、68 条评分标准):
uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-review \ --max-turns 200运行结束后会输出轮次数、Token 消耗、耗时和结果路径,例如results/corporate-ma/.../20260428-142301。随后对产出评分并生成报告:
uv run python -m evaluation.run_eval --run-id <run-id> \ --task corporate-ma/review-data-room-red-flag-review浏览器打开results/<run-id>/report.html,即可看到逐项评分与裁判理由。完整 12 步走查(含模型对比、批量 sweep、对比看板)请参考 docs/tutorial.md。
六、常见问题快速排查 🛠️
| 问题 | 解决方法 |
|---|---|
提示uv: command not found | 新开一个终端,或source ~/.zshrc(uv 装到了~/.local/bin) |
macOS / Windows 上podman连不上 | 执行podman machine start启动虚拟机 |
| Windows 装 WSL2 失败 | 进 BIOS/UEFI 开启 Intel VT-x 或 AMD-V 虚拟化后重试 |
| 重新跑脚本会不会重复安装? | 不会。scripts/setup.sh 是幂等的,已装组件自动跳过 |
七、部署完成后的下一步 🗺️
- 浏览全部任务:
uv run python -m utils.list_tasks --area corporate-ma,按领域/工作类型筛选 - 理解架构:docs/architecture.md 讲解任务模型、Agent 循环与评分流程
- 评测方法论:docs/eval-strategies.md 详解 all-pass 计分与 LLM 裁判机制
- 沙箱原理:sandbox/README.md 说明每个任务独立容器的隔离设计
- 参与贡献:CONTRIBUTING.md 提供添加任务与适配器的完整指引
从克隆到第一次评测跑通,Harvey LAB 的部署远比想象中简单——一条脚本打通跨平台环境,剩下的就是挑选任务、运行模型、查看报告。祝评测顺利!🎉
【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考