ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Jevgrep 的 SWE-bench 研究档案:证据保存机制、校验链路与解读规范

Jevgrep 的 SWE-bench 研究档案:证据保存机制、校验链路与解读规范 【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载导读本文讲解 jevgrep 仓库中 SWE-bench 官方研究证据的归档保存research preservation机制为什么历史上数十轮 spike 实验要与产品代码main分支彻底隔离、如何用不可变快照与 SHA-256 manifest 逐字节固化 358 份研究文件、以及如何正确解读这些源代码历史而不误将其当成可运行承诺或发布验收依据。读完本文你将掌握该仓库证据管理的主干规则——归档边界、校验手段、证据分级与本地运行存储的依赖关系并能在检索旧实验、复现结论时避免踩中证据误读的典型陷阱。一、背景为什么官方 spike 历史需要单独归档jevgrep 是一个面向编码 Agent 的检索 CLI用一句话问题让jg返回相关文件、阅读线索与逐字源码摘录其核心依托 Jev 对目录、文件与声明进行相关性判定见 README.md。在把它做成产品之前仓库经历了大量SWE-bench spike探索性实验——不同的检索策略、打包形态、提示词与评估通路都被反复试错。这些实验是宝贵的证据来源但不能与维护中的产品代码混在一起spike 里包含大量被废弃、被替代甚至失败的 runner 与历史指令若并入main分支会让产品实现与历史尝试边界模糊旧实验的模型、时序、输出与状态描述只属于它自己的研究语境不代表当前发布版本的行为因此 research-archive.md 明确定下规则归档分支与main刻意分离禁止把过时的 runner 或历史说明合并进产品。这一分离原则在仓库文档体系中层层呼应官方基准评估入口 evals/README.md 声明研究档案在 Git 中保存被取代的官方实验但不向main添加过时 runnerspecs/done/jevgrep/README.md 则记录旧 spike 提示词、源码字节、启发式或输出格式无需保持不变——即产品测试不再受旧 spike 约束。二、归档机制archive tag、不可变快照与原始相对路径归档的核心载体是一个archive tagarchive/swebench-spikes-2026-09-26。临时归档分支在保存完成后即被删除只保留该 tag 指向的不可变快照。快照包含全部 358 个此前未被 Git 跟踪的官方研究文件并且严格保留它们在仓库中的原始相对路径包括实验实现experiment implementations与对应测试原生 Agent 测试框架变体native-agent harness variants冻结配置frozen configurations与提示词prompts结果报告与分析result reports and analysis。按原始相对路径存放的意义在于档案中的每个文件仍可对照其历史位置理解上下文研究记录中记录的路径、哈希与引用关系不会因迁移而失效。这也正是 specs/done/jevgrep/research.md 中冻结参考的做法——被冻结的 spike 源码如 hierarchy-unit-locators-spike.ts连同 SHA-256 摘要一起固化原始 trace 与账单另行保留拷贝的审计文件不能替代它们。三、校验链路research-snapshot-manifest.json 与逐字节 SHA-256快照配套一份research-snapshot-manifest.json清单记录其中每个文件的 SHA-256 摘要并且每个字节都对照本地归档验证过every byte was verified against the local archive。这种清单 摘要的校验思想并非只存在于归档环节而是贯穿整个评估工具链可以从 installed.py 的源码中看到一致的实现模式digest(path)用hashlib.sha256计算文件摘要冻结计划frozen plan把 runner、broker、registry、skill、package 等所有必需构件的 SHA-256 写入plan.json的artifacts字段加载计划时逐项校验load_cohort任何构件摘要不匹配立即抛错Frozen artifact changed基线证据同样受保护load_pair对照 fixed-baselines.json 校验基线 receipt、prompt 的prompt_sha256与官方评分结果任何漂移都拒绝执行且基线绝不重跑there is no baseline execution command。由此可见研究档案的 manifest 与评估 harness 的摘要校验同源同构证据一旦冻结就只能通过哈希比对确认未变而不会被重新生成或改写。四、保存的边界不做模型调用、不重跑基线、不重算结果归档保存是一个纯搬运与校验动作明确排除了三类会改变证据语义的操作无模型调用No model calls保存过程不向任何模型发送请求因此不会产生新的费用或新的推理结果无基线重跑baseline reruns基线证据保持其历史状态不会为了改善对比而重跑无结果重算result recomputation官方评分与成本统计保持原样不因归档而重新计算。这与 cost-quality-policy.md 的原则完全一致——每个任务、模型、harness 的基线只运行一次复用固定结果候选变更不构成重跑基线的理由冻结的计划、早先的裁决与原始证据保留当时使用的标准不会为了制造新结果而被重写。五、Git 快照 ≠ 全部证据本地运行存储的不可替代性文档特别强调一个容易被忽略的事实快照是源代码历史不代表每个旧实验都能从全新 clone 运行not a promise that every old experiment runs from a fresh clone。原因在于几类大体积工件根本不进 Git只存在于被忽略的本地运行目录中evals/runs/swebench/与evals/runs/tooling/被.gitignore忽略的 run 存储其中包含原始响应raw responses、Agent 轨迹agent traces、基线产物baseline artifacts、源码快照source snapshots、评估数据集evaluator datasets这些工件的记录路径与哈希保持不变但一旦本地存储丢失就无法仅凭源码快照恢复。这与 installed.md 描述的运行时证据闭环互为表里每次 treatment 都会产出 receipt生命周期收据、agent.patch、raw-rollout.jsonl、proxy.jsonl与jev-traces精确的 Jev 请求/响应体由 gateway_broker.py 在不含认证头的独立容器中留存失败或中断的尝试也一律保留、绝不替换。这些原始轨迹正是归档快照之外的可恢复证据所在。六、证据解读入口五类资料的分工文档给出了一套如何读证据的导航明确了五类资料各自的职责资料职责当前仓库中对应的落地文件Paired agent trace findings配对 Agent 轨迹发现说明基线与检索辅助 Agent 在相同任务上的探索差异归档快照中的evals/implementation/swebench/paired-sol-research-findings.md位于归档 tag 内Context findings上下文发现记录早期交接与输出消费问题归档快照中的evals/implementation/swebench/context-findings.md位于归档 tag 内Historical reports and source历史报告与源码保留包括失败与被取代实验在内的备选方案归档 tag 的evals/implementation/swebench/目录当前main分支仍保留部分 spike 源文件如 hierarchy-unit-locators-spike.tsRetrieval lessons检索教训对合成结论负责architecture-lessons.mdImplementation record实现记录对最终产品证据负责包括失败的质量门槛specs/done/jevgrep/README.md关键解读规则是旧模型、时序、输出与状态陈述只描述它们自己的研究不代表发布。例如 architecture-lessons.md 明确退役了旧 spike 的七分之十成本获胜目标seven-of-ten cost-win target说明它不是产品验收规则evals/README.md 与 specs/done/jevgrep/README.md 也一致声明被更正后的十任务队列曾以accepted: false收场、历史门槛不决定晋升产品改进须按当前架构的评估政策与前一个发布版本对比。七、档案之外被排除的评估与冗余清理归档边界还做了两件减法废弃的个人仓库评估被排除在公共归档之外——其工具、fixtures 与本地归档在用户明确要求下被删除官方 SWE-bench 研究与原始证据则按前述规则完整保留。这与 evals/README.md 中个人仓库 fixtures 与自定义评分评估已废弃、留在 Git 之外、不作为产品验收证据的声明一致冗余的.claudeskill 链接被移除规范化的开发 skills 保留在.agents/skills/避免同一技能以多份副本散落造成版本漂移。八、实践清单在 jevgrep 仓库中安全使用研究档案综合本文所述规则使用该仓库研究证据时请遵循以下清单定位官方 spike 历史先看归档 tagarchive/swebench-spikes-2026-09-26当前main分支只承载维护中的 CLI 与已安装包测试框架校验任何引用归档内文件的操作先对照research-snapshot-manifest.json的 SHA-256 确认字节未变评估场景则依赖 installed.py 对 frozen plan 的自动摘要校验分级把旧实验的结论描述其自身研究与最终产品证据由 architecture-lessons.md 与 specs/done/jevgrep/README.md 负责区分开不以历史 spike 门槛作为发布验收依据保真不要用最便宜的变体拼凑或重跑基线改善对比来制造结果官方任务完成是首要度量完整编码 Agent 成本含失败尝试必须同时报告Jev 成本单独记账细则见 cost-quality-policy.md 与 installed.md备份认识到 Git 快照无法替代evals/runs/swebench/与evals/runs/tooling/的本地运行存储原始轨迹、基线产物与评估数据集的丢失是不可恢复的证据损失。结语研究档案保存的不是能跑的代码而是曾经发生过的证据。jevgrep 用归档 tag 隔离历史、用 SHA-256 manifest 固化字节、用不调用、不重跑、不重算守住证据语义再用本地运行存储补齐 Git 无法承载的大体积原始轨迹。这套机制的价值在于它让每一份旧实验都能被定位、校验、分级与安全引用同时明确划出历史教训与产品验收之间的边界——这正是严谨的基准评测工程benchmark engineering在证据管理上的核心范式也是任何想要复现或扩展 SWE-bench 研究的读者首先应当理解的地基。赞分享【免费下载链接】jevgrepFind code by asking what it does. A CLI for coding agents that uses Jev to discover relevant files and source context.项目地址https://gitcode.com/gh_mirrors/je/jevgrep点击查看免费下载相关推荐CKEditor 5 自定义构建Customized Builds迁移指南从多包源码导入到全新安装方式CKEditor 5 自定义构建Customized Builds迁移指南从多包源码导入到全新安装方式 本指南面向使用旧式「自定义构建」方式集成 CKEdPwndbg kmem-trace 实战用断点追踪内核 SLUB 与 Buddy 内存的分配/释放Pwndbg kmem trace 实战用断点追踪内核 SLUB 与 Buddy 内存的分配/释放 kmem trace 是 pwndbg 内核KernelArchipelago校验和验证数据完整性保证机制Archipelago校验和验证数据完整性保证机制 概述 在现代多游戏随机化系统中数据完整性是确保游戏体验一致性和可靠性的关键因素。Archipelago作游戏开发后端上一篇ipycanvas与NumPy结合高效绘制大规模数据可视化图形下一篇Nim 严格非空检查strictNotNil基于流分析与 not nil 注解的解引用安全机制创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表