ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建

Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建 Harvey LAB部署指南:Linux/macOS/Windows跨平台环境搭建【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是 Harvey AI 开源的法律智能体基准测试平台内含 1,600 个真实感法律任务用于评测大模型 Agent 完成法律工作的能力。本文是一份面向新手的完整部署教程带你用一条脚本完成 Linux、macOS、Windows 三大平台的环境搭建从克隆仓库到跑通第一个法律评测任务全程约 10 分钟。一、Harvey LAB 是什么部署后能得到什么 Harvey LAB 由两部分组成组成说明所在位置任务数据集1,660 个任务覆盖 24 个法律实践领域含合成案卷文档与评分标准rubrictasks/执行测试台harness驱动 Agent 在沙箱容器中读写文档、执行命令并由 LLM 裁判打分生成报告harness/部署完成后你可以✅ 让任意大模型Claude / GPT / Gemini完成真实感法律任务如审阅数据室、起草并购协议✅ 用 LLM-as-Judge 对产出逐条评分生成可视化 HTML 报告✅ 用 sweep 工具批量对比多个模型在同一任务上的表现 官方教程入口docs/tutorial.md二、部署前准备3 项前置检查清单 在跑安装脚本前确认以下三项检查项要求备注Python 版本3.12 或 3.133.14由uv自动管理无需手动装操作系统Linux / macOS /Windows 11Windows 需在 BIOS 中开启 CPU 虚拟化脚本会自动引导安装 WSL2模型 API 密钥Anthropic 密钥必需用作评分裁判OpenAI / Google 密钥可选详见下文 macOS 用户建议先装好 HomebrewLinux 用户需有apt与sudo权限脚本会自动处理。依赖声明见 pyproject.toml容器镜像见 sandbox/Dockerfile。三、一键安装3 步完成跨平台部署 1. 克隆仓库git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs2. 运行一键安装脚本./scripts/setup.sh这个幂等脚本可重复执行、自动跳过已完成步骤会按顺序完成6 个步骤覆盖全部三大平台安装uvPython 包管理器uv sync同步 Python 依赖安装pandocdocx 文档解析器安装podman每个任务的沙箱容器运行时rootless 免 GUI初始化并启动podman machinemacOS / Windows 专属虚拟机拉取沙箱镜像lab-sandbox:latest失败时自动本地构建3. Windows 用户特别注意 ⚠️首次运行会在检测硬件条件后安装 WSL2 并提示重启——重启后重新执行./scripts/setup.sh脚本会自动从断点继续。整个过程完全在 git-bash 中完成无需手动配置。脚本详细逻辑见 scripts/setup.sh。四、配置模型 API 密钥 在仓库根目录创建.env文件已在.gitignore中不会被提交每行一条密钥ANTHROPIC_API_KEY你的密钥 OPENAI_API_KEY你的密钥 # 可选 GOOGLE_API_KEY你的密钥 # 可选Anthropic 密钥必需默认 LLM 裁判用它给 Agent 的产出打分OpenAI / Google 密钥可选仅当你要评测对应模型时配置测试台每次运行会自动加载.env只需配置一次模型适配器源码位于 harness/adapters/支持 anthropic、openai、google、mistral、fireworks 等提供商。五、首次运行验证跑一个真实法律任务 ✨环境就绪后用这条命令验证部署是否成功——让 Agent 完成一个并购数据室红旗审查任务含 60 份案卷文档、68 条评分标准uv run python -m harness.run \ --model anthropic/claude-sonnet-4-6 \ --task corporate-ma/review-data-room-red-flag-review \ --max-turns 200运行结束后会输出轮次数、Token 消耗、耗时和结果路径例如results/corporate-ma/.../20260428-142301。随后对产出评分并生成报告uv run python -m evaluation.run_eval --run-id run-id \ --task corporate-ma/review-data-room-red-flag-review浏览器打开results/run-id/report.html即可看到逐项评分与裁判理由。完整 12 步走查含模型对比、批量 sweep、对比看板请参考 docs/tutorial.md。六、常见问题快速排查 ️问题解决方法提示uv: command not found新开一个终端或source ~/.zshrcuv 装到了~/.local/binmacOS / Windows 上podman连不上执行podman machine start启动虚拟机Windows 装 WSL2 失败进 BIOS/UEFI 开启 Intel VT-x 或 AMD-V 虚拟化后重试重新跑脚本会不会重复安装不会。scripts/setup.sh 是幂等的已装组件自动跳过七、部署完成后的下一步 ️浏览全部任务uv run python -m utils.list_tasks --area corporate-ma按领域/工作类型筛选理解架构docs/architecture.md 讲解任务模型、Agent 循环与评分流程评测方法论docs/eval-strategies.md 详解 all-pass 计分与 LLM 裁判机制沙箱原理sandbox/README.md 说明每个任务独立容器的隔离设计参与贡献CONTRIBUTING.md 提供添加任务与适配器的完整指引从克隆到第一次评测跑通Harvey LAB 的部署远比想象中简单——一条脚本打通跨平台环境剩下的就是挑选任务、运行模型、查看报告。祝评测顺利【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表