
为什么PhyAgentOS坚持先证据后结论执行、证据、判定三事实分离架构深度剖析【免费下载链接】PhyAgentOS-corePhyAgentOS is a Recursive Self-Improving (RSI) physical agent operating system that enables agents to recursively self-improve through agentic workflows.项目地址: https://gitcode.com/gh_mirrors/ph/PhyAgentOS-corePhyAgentOS 是一个递归自改进RSI的物理智能体操作系统它让 Agent 通过 Agentic Workflow 自主执行任务、自我验证并持续进化。它的核心设计哲学只有一句话先证据后结论——执行、证据、判定是三类互不越权的事实任何一层都不允许替另外两层脑补。为什么物理 Agent 不能自说自话给机器人或具身智能体下达指令时最危险的场景不是没做成而是以为做成了。比如让机械臂把杯子放到桌上工具接口返回succeeded但杯子其实还在半空——如果系统直接相信这个返回值错误就会被当作成功沉淀进记忆后续的自我改进只会越改越歪。PhyAgentOS 的做法是执行成功 ≠ 任务成功。它把一次任务拆解为三种彼此隔离的事实事实类型谁产生回答的问题是否可修改执行事实Execution RecordForge Gateway命令跑到哪一步了不可变证据事实Evidence BundlePAOS 采集器执行前后世界长什么样不可变判定事实Verification Verdict独立验证服务用户目标真的达成了吗独立得出执行事实只记账不表态执行记录由网关侧上报契约定义在 PhyAgentOS/verification/contracts.py 中的ExecutionRecord源码注释写得很直白Immutable facts reported by Forge Gateway, never a task verdict网关上报的不可变事实从来不是任务结论。它只记录命令状态running、succeeded、timed_out、unknown…、时间线、输出与错误。而且 PhyAgentOS/forge/evidence.py 中的write_execution是一次写入、终身不改——重放时发现内容不一致会直接报错防止事后美化执行历史。证据事实拍照、哈希、封箱证据采集发生在**动作执行前before和执行终态后after**两个时刻逻辑位于 PhyAgentOS/forge/observation.py通过 WebSocket 持续订阅网关的图像流/ws/images与机器人状态流/ws/state只保留每个图像源最新且经过校验的帧校验媒体类型魔数、大小上限严格保证 after 快照的帧序号晚于 before、且接收时间晚于命令终态时刻——防止拿旧照片充数。随后 PhyAgentOS/forge/evidence.py 的ForgeEvidenceWriter把快照写成不可篡改的证据包每个文件计算 SHA-256 摘要、记录字节数与采集/接收双时间戳打包成evidence_bundle.json。缺什么就如实写进missing_requirements采集失败不会被悄悄吞掉。所有文件均使用原子写入且路径被严格限制在工作区内。判定事实模型只能对着证据说话验证环节由独立的 Verification Service 执行PhyAgentOS/verification/service.py它运行在独立子进程里和干活的 Agent 完全隔开。其系统提示词FORGE_TASK_PROMPT明确规定网关命令成功只是执行证据不是目标达成的证明每条成功准则必须逐条判定satisfied / unsatisfied / unknown并附evidence_refs经验教训Lesson只是非权威建议严禁当作证据引用证据不足以支撑可靠判断时必须输出inconclusive而不是硬猜。请求组装在 PhyAgentOS/verification/request_builder.py模型收到的上下文只包含任务契约、执行记录、经验证通过/标记缺失的证据包和合法引用白名单valid_evidence_refs之外的引用一律无效。也就是说模型想下结论先要有编号的实物证据可引。四种验证模式从关到自愈渐进开启契约TaskVerificationContract提供四种模式行为矩阵详见 docs/zh/04-forge-configuration-reference.md模式语义适合谁off只按执行结果派生成败调试阶段audit记录语义判定但不覆盖执行结果观察验证器表现enforce语义判定决定成败证据不足即失败fail closed生产环境recoveryenforce 有预算的重规划默认最多 2 次需要自愈的任务recovery模式下验证器可输出replan_required并附带recovery_context未达成准则、需保留的约束、行动无关的指导任务随后追加新的 PlanRevision 继续尝试——但重规划次数与截止时间都有硬性预算且不能改写已固化的执行事实与证据。这套判定结果还会喂给经验与进化系统agents.evolution只有带语义判定的任务才会被沉淀为可复用经验晋升新能力还需要多个独立成功任务背书默认 3 个。换句话说自我改进的燃料本身是被验证过的。快速上手在哪里配置这些行为证据采集参数超时、必需图像源、单文件大小上限forge.evidence见 docs/zh/04-forge-configuration-reference.md 第 3 节验证服务开关、模型、证据保留策略all / failed / none、重规划预算agents.verification任务侧验证契约goal、success_criteria、evidence_policydocs/forge/README_zh.md 第 9 节有完整接入契约框架整体概念docs/zh/01-framework-introduction.md。总结为什么这个架构值得借鉴职责分离执行层管发生了什么证据层管世界变成了什么样判定层管目标达成没有谁都不越权全程不可变执行记录一次写死、证据带哈希封箱事后无法篡改审计有底气Fail closed 文化证据缺失就inconclusive、验证器出错就判失败宁可保守也不误报成功改进有门槛只有被证据支撑的成败经验才能进入自改进闭环让递归自我改进建立在可信地基上。对于任何要在物理世界执行动作的 Agent 系统先证据后结论都不只是一条工程规范而是一条安全底线。【免费下载链接】PhyAgentOS-corePhyAgentOS is a Recursive Self-Improving (RSI) physical agent operating system that enables agents to recursively self-improve through agentic workflows.项目地址: https://gitcode.com/gh_mirrors/ph/PhyAgentOS-core创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考