ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Harvey LAB任务完整性守护:validate-task-schema自动化校验完整指南

Harvey LAB任务完整性守护:validate-task-schema自动化校验完整指南 Harvey LAB任务完整性守护:validate-task-schema自动化校验完整指南【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LAB 是一个开源的法律智能体基准Legal Agent Benchmark收录了 1671 个覆盖 24 法律执业领域的真实工作任务。要让 AI 智能体稳定地做法律工作每个任务的元数据task.json必须结构正确——这正是validate-task-schema 自动化校验流程要解决的问题。本文将带你快速看懂这套任务完整性校验机制如何运行以及如何在本地一键验证你自己的任务。一、Harvey LAB 是什么一句话概括一个用来评测和练法律智能体的开源基准。它由两部分组成组成说明位置任务数据集1671 个任务每个任务含智能体指令、合成文档、评分标准tasks/执行框架运行智能体、提供工具、调用 LLM 裁判评分harness/ 与 evaluation/每个任务都长这样一个目录 一份 task.json 元数据 一堆合成文档.docx/.xlsx/.eml 等。比如并购尽调任务tasks/corporate-ma/review-data-room-red-flag-review/ ├── task.json # 任务定义标题、指令、交付物、评分标准 └── documents/ # 60 份合成案件文档 核心思想task.json就是任务的身份证——智能体读instructions裁判读criteria打分。身份证一旦格式错乱整个评测就失真。二、为什么需要 validate-task-schema 自动化校验想象一下1671 个任务、24 个执业领域、多人协作维护。如果某个任务的 JSON 少写了criteria、评分标准 ID 重复、或交付物字段类型写错跑评测时才会爆炸——成本极高。所以项目内置了一道自动门禁.github/workflows/validate-task-schema.yml 工作流在以下场景自动触发✅每次 Pull Request—— 提交前先把关✅每次推送到 main 分支—— 保证主干数据始终健康它做的事情很简单粗暴但可靠uv sync --frozen # 安装与锁定文件一致的依赖 uv run pytest tests/ -v # 跑完整离线测试套件含任务完整性测试 对新手来说这就像考试前的自动查重你不用盯着 CI 日志看只要绿灯亮说明任务数据全部合格。三、任务完整性校验的 5 道关卡真正干活的是 tests/test_task_integrity.py —— 它会遍历tasks/下每一个任务目录逐项检查。用表格看清它验证了什么关卡检查内容不通过的典型原因1️⃣ 任务枚举tasks/目录存在且至少发现 1 个任务、1 个执业领域目录结构被误改2️⃣ JSON 合法性task.json必须可解析title非空且不少于 5 个字符JSON 语法错误、标题偷懒3️⃣ 内联评分标准必须含criteria列表≥1 条标准任务的每条标准需有id、title、match_criteria且 ID 全局唯一禁止遗留的weight字段标准 ID 重复、残留旧字段4️⃣ 交付物引用每条标准的deliverables必须是文件名字符串列表写成了字符串而非数组5️⃣ 跨任务一致性全库至少覆盖 2 种工作类型analyze/draft/review/research任务单一化第 5 关的 all-pass 评分 背景Harvey LAB 采用全通过才算满分策略——任何一条标准失败整题记 0 分。这正是校验必须严格的原因详见 docs/eval-strategies.md。四、本地如何执行任务校验一键三连不想等 CICONTRIBUTING.md 提供了本地校验的黄金流程三步完成第 1 步装好环境git clone https://gitcode.com/GitHub_Trending/ha/harvey-labs cd harvey-labs ./scripts/setup.shscripts/setup.sh 是幂等脚本自动补齐 uv、依赖、pandoc、容器运行时重复执行也安全。第 2 步先看一眼任务再校验uv run python -m utils.describe_task corporate-ma/review-data-room-red-flag-reviewutils/describe_task.py 会打印任务标题、文档数量、完整评分标准清单——写任务时的体检仪。第 3 步跑完整性测试uv run python -m pytest tests/test_task_integrity.py几秒钟内即可对全库任务完成 schema 校验。五、给贡献者的完整工作流结合 docs/tutorial.md 与 CONTRIBUTING.md推荐按这个节奏贡献任务建目录tasks/执业领域/任务名/放入task.json与documents/写 rubric每条标准写清 PASS if … / FAIL if …不要加遗留weight字段本地体检describe_taskpytest tests/test_task_integrity.py提交 PRvalidate-task-schema 工作流自动复检绿灯即安全合并六、写在最后validate-task-schema 看似只是跑个测试实则是 Harvey LAB 能容纳上千个法律任务而不乱的基石——用自动化校验换取数据完整性用数据完整性换取评测可信度。下一步建议读一遍 docs/tutorial.md跑通一次完整的任务执行 → LLM 裁判评分流程参考 docs/architecture.md 理解任务模型与执行框架挑一个任务describe_task看看感受 rubric 的颗粒度⚖️ 当你理解了任务如何被定义你就理解了法律智能体如何被公平地考试。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表