Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建
2026/9/21 16:39:58 网站建设 项目流程

Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

Harvey LAB(Legal Agent Benchmark)是 Harvey AI 开源的法律智能体基准测试平台,内含 1,600+ 个真实感法律任务,用于评测大模型 Agent 完成法律工作的能力。本文是一份面向新手的完整部署教程,带你用一条脚本完成 Linux、macOS、Windows 三大平台的环境搭建,从克隆仓库到跑通第一个法律评测任务,全程约 10 分钟。

一、Harvey LAB 是什么?部署后能得到什么 🧭

Harvey LAB 由两部分组成:

组成说明所在位置
任务数据集1,660 个任务,覆盖 24 个法律实践领域,含合成案卷文档与评分标准(rubric)tasks/
执行测试台(harness)驱动 Agent 在沙箱容器中读写文档、执行命令,并由 LLM 裁判打分生成报告harness/

部署完成后,你可以:

  • ✅ 让任意大模型(Claude / GPT / Gemini)完成真实感法律任务,如审阅数据室、起草并购协议
  • ✅ 用 LLM-as-Judge 对产出逐条评分,生成可视化 HTML 报告
  • ✅ 用 sweep 工具批量对比多个模型在同一任务上的表现

📖 官方教程入口:docs/tutorial.md

二、部署前准备:3 项前置检查清单 📋

在跑安装脚本前,确认以下三项:

检查项要求备注
Python 版本3.12 或 3.13(<3.14)uv自动管理,无需手动装
操作系统Linux / macOS /Windows 11Windows 需在 BIOS 中开启 CPU 虚拟化,脚本会自动引导安装 WSL2
模型 API 密钥Anthropic 密钥必需(用作评分裁判);OpenAI / Google 密钥可选详见下文

💡 macOS 用户建议先装好 Homebrew;Linux 用户需有aptsudo权限(脚本会自动处理)。

依赖声明见 pyproject.toml,容器镜像见 sandbox/Dockerfile。

三、一键安装:3 步完成跨平台部署 🚀

1. 克隆仓库

git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs

2. 运行一键安装脚本

./scripts/setup.sh

这个幂等脚本(可重复执行、自动跳过已完成步骤)会按顺序完成6 个步骤,覆盖全部三大平台:

  1. 安装uv(Python 包管理器)
  2. uv sync同步 Python 依赖
  3. 安装pandoc(docx 文档解析器)
  4. 安装podman(每个任务的沙箱容器运行时,rootless 免 GUI)
  5. 初始化并启动podman machine(macOS / Windows 专属虚拟机)
  6. 拉取沙箱镜像lab-sandbox:latest(失败时自动本地构建)

3. Windows 用户特别注意 ⚠️

首次运行会在检测硬件条件后安装 WSL2 并提示重启——重启后重新执行./scripts/setup.sh,脚本会自动从断点继续。整个过程完全在 git-bash 中完成,无需手动配置。

脚本详细逻辑见 scripts/setup.sh。

四、配置模型 API 密钥 🔑

在仓库根目录创建.env文件(已在.gitignore中,不会被提交),每行一条密钥:

ANTHROPIC_API_KEY=你的密钥 OPENAI_API_KEY=你的密钥 # 可选 GOOGLE_API_KEY=你的密钥 # 可选
  • Anthropic 密钥必需:默认 LLM 裁判用它给 Agent 的产出打分
  • OpenAI / Google 密钥可选,仅当你要评测对应模型时配置
  • 测试台每次运行会自动加载.env,只需配置一次

模型适配器源码位于 harness/adapters/,支持 anthropic、openai、google、mistral、fireworks 等提供商。

五、首次运行验证:跑一个真实法律任务 ✨

环境就绪后,用这条命令验证部署是否成功——让 Agent 完成一个并购数据室红旗审查任务(含 60 份案卷文档、68 条评分标准):

uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-review \ --max-turns 200

运行结束后会输出轮次数、Token 消耗、耗时和结果路径,例如results/corporate-ma/.../20260428-142301。随后对产出评分并生成报告:

uv run python -m evaluation.run_eval --run-id <run-id> \ --task corporate-ma/review-data-room-red-flag-review

浏览器打开results/<run-id>/report.html,即可看到逐项评分与裁判理由。完整 12 步走查(含模型对比、批量 sweep、对比看板)请参考 docs/tutorial.md。

六、常见问题快速排查 🛠️

问题解决方法
提示uv: command not found新开一个终端,或source ~/.zshrc(uv 装到了~/.local/bin
macOS / Windows 上podman连不上执行podman machine start启动虚拟机
Windows 装 WSL2 失败进 BIOS/UEFI 开启 Intel VT-x 或 AMD-V 虚拟化后重试
重新跑脚本会不会重复安装?不会。scripts/setup.sh 是幂等的,已装组件自动跳过

七、部署完成后的下一步 🗺️

  • 浏览全部任务uv run python -m utils.list_tasks --area corporate-ma,按领域/工作类型筛选
  • 理解架构:docs/architecture.md 讲解任务模型、Agent 循环与评分流程
  • 评测方法论:docs/eval-strategies.md 详解 all-pass 计分与 LLM 裁判机制
  • 沙箱原理:sandbox/README.md 说明每个任务独立容器的隔离设计
  • 参与贡献:CONTRIBUTING.md 提供添加任务与适配器的完整指引

从克隆到第一次评测跑通,Harvey LAB 的部署远比想象中简单——一条脚本打通跨平台环境,剩下的就是挑选任务、运行模型、查看报告。祝评测顺利!🎉

【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询