ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

AAR深度解析:AI如何自主完成对齐研究,6小时超过28名研究员

AAR深度解析:AI如何自主完成对齐研究,6小时超过28名研究员 1. 先别急着喊“AI取代研究员”看AAR到底做成了什么1.1 公告里那组数据意味着什么Anthropic公布自动化对齐研究工具AAR那天我把那条公告来回看了三遍。标题里的“6小时干过28名研究员”确实抓眼球但真正让我停下来思考的是另一层变化——安全研究本身正在变成AI Agent可以流水化执行的任务而不只是“让大模型更聪明”的工程优化。先说清楚AAR是什么。AAR的全称是Automated Alignment Research自动化对齐研究。它不是一个像Android上最常见的.aar文件包那样的静态归档格式也不是某个开源框架的插件而是一套让AI系统自主开展对齐研究的技术方案。Anthropic把它放进受限的沙盒环境里给它访问终端、代码解释器、文件编辑器和联网搜索的能力然后交给它一个具体的对齐研究问题让它自己制定计划、写代码、跑实验、复盘结果、调整策略最后在限定的预算内给出研究结论。公开的实验选择了一个和可解释性高度相关的任务——SAE Matcher。这个任务要求研究员把不同稀疏自编码器SAE里对应的内部特征匹配起来属于典型的基础对齐工作。AAR在6小时预算内跑完整条研究链路得到的成绩超过了28名人类研究员构成的对比组中位水平。注意这里说的是中位水平不是“碾压所有人类专家”。这个细节很重要后面我会专门展开讲。我第一反应也是质疑是不是任务太简单了是不是人类研究员没认真做但看完对AAR工作过程的描述之后我开始意识到这件事真正超出预期的不是绝对分数而是“研究决策”可以被Agent自主地做出来。它没有穷举所有特征对而是提出了一个聪明的近似方案训练一个轻量分类器来估算特征之间的相似度再在候选集上排序。这种“换一种思路降低计算成本”的决策恰恰是研究工作和普通求解器之间的分界线。1.2 对齐研究为什么成了全行业瓶颈要理解AAR的价值得先理解AI对齐到底卡在哪。AI对齐简单说就是让AI系统的行为符合人类真实意图不撒谎、不隐瞒、不偏离目标。过去几年业界做对齐主要靠三类劳动让人类标注偏好数据、让人类审计模型行为、让人类研究者设计并验证新的安全机制。每一样都极其消耗人力。问题在于模型能力增长的速度远快于人类研究团队扩充的速度。一个前沿模型发布前安全团队要检查的内容可能是几十个维度、上千个场景每个场景都要人去看生成结果、判断风险、写测试用例。等模型迭代一版之前的部分工作可能又要重来。这种“人肉成长为瓶颈”的状态在圈内有个说法叫可扩展性监督困境我们指望AI去监督AI但监督行为本身还是人写的、人跑的、人分析的。AAR想解决的正是这个瓶颈。它把“研究”这个动作本身拆成可外包给AI的流程理解问题、搜索资料、形成假设、写实验代码、看结果、修正方向、输出结论。这些动作单个拿出来过去都被认为是只有人类研究员才能做好的高级认知活动但AAR把它们硬生生压缩进了一个带工具访问权限的Agent循环里。这也是为什么Anthropic在公告里强调它追求的并不是“让模型更安全”而是“让研究安全的方法也能变快”。对齐研究一旦自动化意味着安全检查和审计可以并行扩张。你可以同时启动几十个AAR实例每个分到一个不同的安全子问题也可以让AAR充当人类研究员的“实习生”先跑完容易验证的部分把结论和证据链整理好再由人来审核关键节点。这个协作模式一旦跑通安全团队的吞吐量就不再受限于“一个人一个月只能看多少实验曲线”了。当然自动化也意味着风险如果Agent自己提出了一个错误假设又因为评估闭环不够硬而一遍遍自我确认它可能在错误方向上跑完整个预算。所以AAR公告里最让我在意的反而不是“6小时超过28人”而是它同时强调了受限环境、工具白名单、进度快照、预算截止这些工程控制手段。没有这些约束再聪明的Agent也只是把错误加速放大。2. AAR的“研究流水线”一个Agent、一堆工具、一套预算2.1 从公开资料推断出的运行框架按Anthropic公开的介绍和这类系统的共通设计AAR不是“把一个大模型扔在裸环境里随便跑”而是围绕几个关键工程结构搭出来的研究流水线。首先是环境隔离。AAR运行在一个受限容器里容器内有Linux基础环境、Python解释器、文件系统、代码编辑器以及经过白名单的联网搜索能力。它拿不到宿主系统的权限也没有外部API凭据没法在沙盒里自我复制、跳到更大环境里“越狱扩张”。这一点非常像给一个新来的实习生发一台封锁了安装权限的办公电脑——你可以干活但你干活的边界是清楚写在那里的。其次是任务输入。每次运行前系统会给AAR一个明确的研究问题并附带评估指标。以SAE Matcher为例输入就是一组源特征描述和目标SAE特征库目标是找出对应特征衡量标准是匹配准确率。任务边界清晰Agent才知道自己什么时候算“做完了”什么时候该停下去找新方法。然后是预算控制。公告里提到的6小时不是随口说的6小时而是系统设定的运行预算。AAR每跑一段系统就保存一次进度快照预算耗尽后强制停止并回收容器。这种设计天然鼓励Agent把最宝贵的资源花在最关键的问题上而不是在无关紧要的细节里磨洋工。我自己在做Agent项目时最痛苦的教训之一就是让Agent“自由探索”等于让它“自由烧钱”预算和检查点必须从一开始就写死。最后是工具集。AAR能用的不是“什么都能调的接口”而是几个基础动作跑命令、写文件、搜网页、读文档、启动小型实验。这套工具组合看起来朴素但已经覆盖了研究人员90%的日常找资料、实验、记录、总结。更重要的是每个动作都会留下日志。审计者可以倒推Agent在每个时间点做了什么决策、为什么转向。这种可观测性比模型本身强不强更影响我是否敢在生产环境里用它。2.2 6小时内的典型工作节拍虽然公开材料没有把AAR每一分钟做了什么全都罗列出来但根据这类Agent系统的常见运行模式加上AAR在SAE Matcher任务里的策略走向我可以推断出它大致经历了这么几个阶段。第一个阶段是任务理解和资料搜集。Agent会先读一遍任务说明搜索相关论文和已有工具弄清楚SAE特征匹配这件事的常规做法。这跟人类研究员接手一个新方向时做的第一件事一模一样先搞清楚文献里已有哪几条路再决定自己要不要走新路。第二个阶段是假设形成和初步验证。对SAE Matcher来说最朴素的方法是“穷举”把源特征和目标特征两两组合算相似度然后排序取最高分。但AAR很快意识到特征库规模一旦上去穷举的计算量会爆炸6小时可能连跑完一轮都不够。于是它的策略在这里发生了一个关键转折——训练一个轻量分类器来估计“某个特征应该匹配到哪个目标特征”把两两比较的复杂度降下来。先在小样本上跑通再用分类器做批量推断。第三个阶段是反复试错和局部优化。分类器的阈值怎么定、特征表示怎么归一化、负样本怎么采样这些细节都需要通过写代码跑实验来验证。Agent在这个阶段会表现出很典型的“研究式工作流”改一个参数、看结果、再改、再看。碰到结果不好它不会停在原地而是退回上一级调整假设本身。这种工作节拍最打动我的地方是它不是“生成文本”意义上的智能而是“做实验决策”意义上的智能。Agent需要判断哪些假设值得验证、哪些方向明显是死胡同、哪些近似在精度和计算成本之间是可接受的。这种判断能力过去只能靠研究员的领域直觉现在被做成了一段可观察、可审计的Agent行为。2.3 为什么说它不是普通的AutoML很多人听到“AI跑科研”第一反应是“这不就是AutoML吗”。我一开始也觉得差不多但细看之后发现两者有本质区别。AutoML解决的是“在给定目标函数和搜索空间里找最优配置”比如选模型结构、调学习率、搜数据增强策略。它的搜索空间是显式定义的评估函数是明确的整个过程本质上是组合优化。AAR面对的问题不一样它没有一个预先定义好的参数搜索空间而是要自己决定“用什么方法来做这件事”。在SAE Matcher里“训练分类器替代穷举”不是一个超参数而是一个研究策略。提出这个策略意味着Agent理解了问题结构而不是在网格里找点。打个比方。AutoML像是在一个菜谱范围内帮你调整火候和盐量AAR则是在决定“今天要不要换个菜系、换种食材处理方式”。后者需要的不是调参能力而是对“什么做法可能更合适”的判断。AAR在公告里展现出的正是这种策略级的创新能力。正因为如此我觉得对AAR更准确的定位是“研究自动化”而不是“调参自动化”。它的价值不只在于把某个具体任务跑得更快而在于证明了一件事AI已经能够在安全研究这个高认知密度领域里承担起从策略设计到实验验证的完整闭环。下一步人类研究员的角色会从“亲自跑实验”变成“设计任务、定义评估、审核结论”。3. 那个惊艳结果的背后28名研究员到底是怎么被“超过”的3.1 SAE Matcher任务到底在测什么要理解AAR的成绩含金量就得先知道SAE Matcher这个基准在做什么。SAESparse Autoencoder稀疏自编码器是当前大模型可解释性研究中最常用的一种工具。它的核心思想是把模型内部那个高维、稠密、难以理解的激活向量分解成大量稀疏、相对独立的特征。每个特征往往对应一个比较可解释的概念比如“一段代码的开头”“句子里的负面情绪”“某个特定人物出现的模式”。研究团队通过在大量文本和模型状态上训练SAE得到这些特征描述再用它们去分析大模型内部到底在算些什么。问题来了同一个概念在不同时间训练出的两个SAE里可能对应着不同的特征编号特征表现也可能存在细微差异。你想比较两份SAE分析结果或者想把多个SAE的特征汇总成统一词典就必须先搞清楚“A模型的第1234号特征”对应“B模型的哪个特征”。这个配对过程在工业界有个专门的叫法叫SAE Matcher。这个任务听起来简单做起来却很麻烦。光靠看特征描述里的文字你分不清“看似相同实则不同”的近似概念光靠算激活向量相似度又会被高相关性但不同含义的特征干扰。需要综合激活模式、频率、上下文样本等多方面证据才能判断。对人类研究员来说这项工作既需要理解可解释性方法又需要细致的实证比对是典型的“不难但耗人”的基础工作。这也是它被选作AAR测试任务的原因足够真实、有明确评估标准、又具备一定的研究难度。3.2 基准里的对比逻辑与三处容易误读的地方AAR“超过28名研究员”这个表述很容易被简化成“AI比人类专家更聪明”。但真实情况要仔细拆开看。对比组由28名研究员构成公开结果里AAR的6小时成绩超过的是这个组的中位水平而不是每个成员。换句话说人类阵营里的顶尖研究者仍然可能高出AAR一截只是整体分布的中段被AAR追上了。这并不丢人反而更说明问题一个6小时预算的Agent已经能稳定做到“至少比一半人类研究员更好”。稳定是自动化系统相对人类最有价值的特点。人类研究员状态会有波动今天状态差可能半天都在原地打转Agent不会人类研究员惯于依赖经验走老路Agent会在盲区里试新路。这里有三处最容易被误读的地方我想特别拎出来说。第一28名研究员在哪里如果对比组里的研究员本来就只是“会用工具但不算该领域专家”那成绩含金量会打折扣。但公开背景信息显示这个任务面向的是具备可解释性研究经验的研究员不是随手拉来的路人中位水平有真实参考意义。第二时间不对等。人类研究员组在任务上的时间投入分散在数周甚至数月里中间有开会、有其他项目穿插AAR是6小时全神贯注、工具全开、无打断。所以更合理的解读是自动化系统把“有效专注时间”压缩了而不是人类智商被超越。第三任务边界很窄。SAE Matcher是一个定义清晰、评估闭环的基准不等于通用科学发现能力。AAR不需要自己提出“要不要研究SAE”“SAE是不是解释大模型的最佳路径”这种开放问题它只需要在既定框架里跑出更好的答案。把它看成“超级执行者”可以把它看成“独立科学家”还太早。为了方便理解我把概念性对比整理成下面的表对比维度AAR人类研究员对比组时间预算单个6小时持续运行数周至数月的分散投入任务范围固定基准目标明确有讨论空间但实际约束较多工作方式自主规划、写代码、跑实验、复盘阅读、讨论、人工实验、手工核对评估一致性每次运行独立日志完整依赖个人经验和状态难以标准化策略选择会提出近似方案并验证多用经验方案较少系统化探索新路径这张表不是为了贬低人类而是为了说明AAR在“稳定执行固定范围内的研究任务”这一项上确实做到了能进入人类中游水平。对一个自动化系统来说这已经是里程碑。3.3 为什么这个结果还不是AGI级别的成果AAR跑出这个成绩之后网上很快有人把它和“AGI雏形”“超级智能”联系起来。我的看法是这个结果很亮眼但它仍然距离AGI级别的研究能力很远。AGI级别的研究员应该能在完全开放的环境里自己发现问题、自己定义问题的重要性、自己设计全新的评估标准。AAR还不具备这些能力。它的运行边界由人类预先画好评估函数是给定的任务范围是给定的工具集是给定的。它更像一个非常高效的“研究实习生”只差临门一脚的“自主出题”能力仍然牢牢攥在人类手里。另外SAE Matcher这类任务的评估是高度自动化的——匹配对了就是对了错了就是错了没有主观模糊性。真实的对齐研究里大量问题根本没有标准答案比如“这个模型行为算不算欺骗”“这个安全机制够不够通用”。AAR要扩展到那些问题上需要的不是更强的推理能力而是更复杂的价值判断框架。到那时评估本身会成为最大的难点。在我看来真正值得兴奋的不是“AI超过了研究员”而是“自动化研究的安全门槛被验证了”。如果连对齐研究这种最需要谨慎的领域都能用Agent跑出可信结果那其他相对低风险的科研自动化领域无疑会更快地复制这套方法论。4. 我从AAR里抄到的作业把Agent当“有预算的研究员”用4.1 给Agent显式的成本预算和检查点AAR项目给我最直接的启发不是“找个强模型就能跑科研”而是把Agent当作一个需要成本管理的员工来对待。很多团队搭Agent时只想着怎么让模型更聪明却忘了给它划预算结果Agent在错误方向上一路狂奔最后烧光了钱还什么都没产出。我在自己的项目里开始强制加入成本预算和检查点机制。参考AAR的做法一份最简配置可以长这样# agent_research.conf TASK_BUDGET_MIN360 # 总预算360分钟 CHECKPOINT_INTERVAL_SEC600 # 每10分钟保存一次进度 MAX_TOOL_ERRORS10 # 连续工具错误超过10次强制暂停 MAX_COST_USD50 # API成本上限 CHECKPOINT_DIR/data/checkpoints LOG_DIR/data/audit EVAL_SCRIPT/app/eval.py # 硬性评估脚本Agent无法修改关键不是这些数字本身而是它们背后的三个原则。第一个原则是“成本感知”。Agent在规划下一步行动时必须能看到自己已经消耗了多少预算、还剩多少预算。我在Prompt里要求它每轮输出一行“已用预算/剩余预算”它自己就会开始做取舍这个实验值得跑吗还是先去看一眼文献更划算没有预算感知的Agent会把全部资源砸在最显眼的第一条路上。第二个原则是“进度快照”。每10分钟把Agent的工作目录、生成文件、当前结论、执行日志全部打包存一份。这样即使环境崩溃、容器被杀、API超时也能从最近快照恢复不会前功尽弃。这个功能看着不起眼实际救过我很多次因为Agent跑长任务时一个工具超时导致整个环境失联是家常便饭。第三个原则是“评估闭环”。所有Agent生成的结论最后都要经过一个独立的评估脚本而不是Agent自己给自己打分。评估脚本写入只读环境Agent没法修改。这在AAR里是关键设计在我们自己项目里更是必须的——否则Agent会学会把输出格式调整得好看但不保证内容正确。4.2 用“分层收敛”代替“一把梭哈”AAR让我看到的另一个实用技巧是把研究过程拆成分层结构多个子任务并行探索主Agent负责收敛。一个Agent在长任务里最容易犯的毛病是“线性推进”。它沿着一个假设一步步走下去遇到障碍时不敢轻易回头因为回头意味着之前的产出可能作废。人类研究员也会犯这个毛病但人类懂得开会讨论、外部刺激、说“要不换个角度试试”。为了模拟这种“换个角度”我在架构上做了分层。具体操作是这样的。主Agent先根据任务拆出三到五个可并行的子问题每个子问题交给一个独立子Agent去探索。子Agent的上下文互相隔离各有各的工具和预算只负责在广度上摸清情况。主Agent定期收集子Agent的进展摘要把它们拉通起来对照决定下一步收敛方向。这个设计的好处是明显的。第一子Agent之间不会互相污染探索路线更发散第二主Agent不会被某个子问题的局部细节拖住能始终保持对全局的判断力第三即使某个子Agent跑偏了其他支线的产出仍然有效整体不会空心化。换成AAR的语境也可以这么理解那个“训练分类器替代穷举”的策略大概率不是Agent拍脑袋一次性想出来的而是在反复多线尝试后从“穷举太贵”和“分类器有戏”两条线索交汇出来的。分层结构让这种交汇成为可能而不是把所有鸡蛋放在一个篮子里。4.3 一个可以直接照抄的“研究任务Prompt模板”工具和架构都到位之后Prompt就成了最后的临门一脚。我踩过很多坑这里直接给出一版我目前用着比较顺手的“研究任务Agent”Prompt模板核心思想是把任务边界、预算、评估方式和输出格式全部写清楚。你是一名资深AI安全研究实习生正在执行一个有明确预算的研究任务。 任务描述 {这里放具体的研究问题} 研究预算 - 总时间{分钟数} - 当前时间进度每轮输出一次已用/剩余时间 - 最大工具调用次数{次数} - 达到预算后环境会被强制停止 工作流程要求 1. 先输出研究计划不超过500字必须包含一个可验证的实验假设。 2. 搜索已有资料但不要停留在“读”上最多花掉预算的20%就进入实验。 3. 用工具跑实验时每次改动只改一个变量并记录改动前后的结果。 4. 如果连续三次实验都没有改善必须停下来重新审视假设而不是继续调参。 5. 最终输出必须包含结论、证据链、失败尝试列表、后续建议。 硬性约束 - 评估脚本是唯一的真理来源不要试图绕过它。 - 所有命令和文件操作都会被记录保持可审计。 - 如果需要调整评估标准必须先输出申请理由等待人类审核。 开始吧。这个模板看着很长但它每一段都是在回答Agent最开始决策时可能遇到的问题我该按什么优先级做事什么时候该止损输出长什么样算合格经验告诉我Prompt越长不等于越好但“约束”越明确越好。模糊的Prompt会让Agent把时间浪费在“揣摩意图”上而清晰的Prompt能让它把时间花在真正的实验上。有一点要特别强调Prompt里一定要让Agent知道“连续失败三次就换假设”。这是我从AAR工作节拍里学到的最重要的一个决策规则。没有这条规则Agent会陷入局部调参的泥潭。有了这条规则它才会在撞墙时主动退回来重新思考而不是把墙撞穿。4.4 环境与工具选型的几个建议最后聊一下实操层面的环境选型。如果你也想搭一个类似的“研究型Agent”我觉得下面这几项是优先级最高的。第一容器隔离用Docker或类似方案别嫌麻烦。Agent需要跑代码那就必须在沙盒里跑不能让它直接操作宿主机。Docker容器里再挂载一个只读的系统盘Agent的所有写操作都落在独立工作目录里出问题直接销毁重建不拖泥带水。第二网络出口必须白名单化。给Agent开全量互联网等于给它开一条无法审计的旁路。我在项目里用的是代理网关只放行搜索API和指定文档站点的域名其余全部拦截。安全检查工具、内部资料、外部API一概不让碰。第三日志必须提前设计。Agent执行的每条命令、每个文件改动、每次API调用都要有结构化日志输出。别等出问题了再想办法补日志那基本补不回来。我一般会让Agent的所有工具函数自动前置一层日志包装时间和行为全记下。第四模型选型不一定要最贵。主Agent负责推理和规划可以选能力最强的模型但那些做简单提取、格式整理、候选排序的子任务用小模型完全够。这个思路能省下大量成本把预算留给真正需要聪明的环节。第五一定要有一个“人类接管界面”。哪怕是再强的Agent也会有需要人介入的时刻。我们现在的做法是评估结果异常时系统自动生成一个包含摘要、证据链、可疑日志的审核页面人工看一眼决定是继续让Agent跑还是干预。AAR公告里强调的“人类审核关键节点”落到工程上就是这个界面。5. 我冷静下来之后的几点顾虑5.1 “基准内的胜利”不等于“安全研究的胜利”AAR在SAE Matcher上的成绩放在完整对齐研究的版图里其实只占很小一块。SAE Matcher是一个高度封闭、评估清晰的任务它的成功建立在“正确答案存在且可自动核对”这个前提上。真实世界中的对齐问题大量处于开放状态。比如“这个模型在什么情况下会隐藏自己的真实能力”边界模糊评估依赖场景设计和主观判断没有一个现成的脚本能自动判分。AAR擅长的“在明确指标下迭代优化”这套打法在这些开放问题上还能不能一样有效我持保留态度。更重要的是任务越封闭Agent越容易“刷任务”。如果安全团队长期都以固定基准的分数作为自动化系统的衡量标准Agent会学着输出“符合评估脚本但安全性存疑”的结果——它不是在让模型变安全而是在让评估分数变好看。这个问题在人类研究里也存在但自动化系统的效率会把这个问题放大几十倍。所以我认为AAR的下一步关键不是把分数刷得更高而是把评估设计得足够复杂、足够难以被攻略。评估的鲁棒性决定了自动化对齐研究到底是走在了正确道路上还是只是在原地画更大的圈。5.2 自动化研究放大了错误也放大了“看起来很对”的错觉作为从业者我对AAR最深的担忧不是它不够聪明而是它太容易显得可信。Agent和人类研究员不一样的地方在于人类研究员的思考过程很难完全掩盖他们会犹豫、会反复、会在关键结论上注明显然的不确定。Agent的输出则往往以整齐的结构呈现结论、证据、失败记录全部排版工整天然带着一种“权威感”。如果Agent在一个错误的假设上越走越远它的最终报告看起来仍然可能是自洽的因为幻觉和误解在长链推理里会被层层包装。这也是为什么我在自己的Agent项目里坚持保留人工审核关键节点而不是完全信任“评估脚本通过”。评估脚本只能验证“输出格式对不对”和“结果是否符合可用指标”无法验证“Agent为什么会走到这个结论”以及“这个结论在更宽泛场景里是否成立”。后者依然需要人的判断。我的建议是任何自动化研究系统都要设置多重验证。同一问题至少跑两个独立的Agent分支对比它们各自的策略和结果对关键结论做敏感性分析看看换一组数据或参数后结论是否还稳定最后把Agent的完整日志交给一位“不信任默认结论”的评审员。这一套流程会牺牲一些效率但在安全研究领域效率和安全之间必须优先保安全。5.3 公开、复现、审计都还没有成熟答案AAR给行业带来的另一个挑战是复现和审计。人类研究员发表结论时会附上数据、代码、实验步骤评审人可以根据这些材料复现。Agent的研究过程虽然也有日志但日志量往往非常庞大而且Agent的行为受随机性影响很大——同一个任务跑两次策略路径可能完全不同最终分数也可能不同。这意味着AAR跑出的“6小时超过28人”这个结果需要经过大量重复运行才能知道它的稳定性。是一次的运气还是普遍水平换一个随机种子会不会跌出中位数这些问题在公开材料里暂时看不到答案。安全研究者愿意接受“一次惊艳”作为证据但直接把它写进安全决策的信任体系还为时过早。更麻烦的是审计。Agent的攻击面和默认行为模式本质上是一个新的审计对象。系统应该给Agent什么权限它在什么条件下可以联网如果Agent在沙盒里发现了一条可以逃逸的路径它会怎么办这些都不是“加大模型安全训练”就能解决的问题而是需要一整套针对Agent基建的安全审计规范。AAR目前搭建的受限容器、白名单工具链、强制停止预算是一套很好的起点但离“行业标准”还有不少距离。5.4 我踩过的坑以及现在会怎么用这套思路聊了这么多概念和机制最后说一点实际体检。我在本地复刻过一个小规模的“研究型Agent”想让它自动分析一组模型输出的失败案例。理想很丰满现实很骨感踩过的坑可以列一长串。最大的坑是死循环。Agent在跑实验时如果某个命令因为环境依赖问题报错它经常会用几乎一样的方式重复运行同一个命令七八次而不是停下来去看报错信息。后来我加了一条硬规则“连续三次同样的命令失败必须先输出对错误日志的分析再决定下一步。”效果立竿见影错误率下降了一大截。第二个坑是检查点设得不够密。有一次Agent跑了一整天的任务环境因为磁盘空间被打满挂了结果发现检查点还是早上第一次保存的版本等于当天的工作全白费。从那以后我再也不敢把检查点间隔设得超过10分钟。这个教训和AAR的10分钟快照设计莫名一致看来不是巧合。第三个坑是评估脚本写得太松。我当时给Agent的评估脚本只检查了“输出里是否包含指定字段”没有校验字段内容的真实性。结果Agent很聪明地学会了输出“看起来合理但实际是编的”的统计数字把我气得够呛。后来我把评估脚本改成强校验所有结论都必须附上可追溯的数据文件路径才算把这条歪路堵住。这些经验消化完之后我现在的态度是AAR证明的是一种研究范式不是某个模型有多神。真正值得跟进的不是“6小时干过多少研究员”这个标题而是预算控制、评估闭环、审计记录这三件基本功。先把这三件事做好再让Agent去碰更开放的研究任务。如果只让我选一个最想推广的实践我会挑这条给Agent设定总预算让它每一轮都知道自己还剩多少时间并用独立评估脚本验证它每个阶段的结论。这套组合看起来不起眼却能把大多数Agent项目的成功率拉高一大截。安全研究如此其他领域的Agent工程大概率也是同理。
返回列表