ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

AI智能体边工作边学习,靠谱吗?一篇论文戳破了“自我进化“的滤镜

AI智能体边工作边学习,靠谱吗?一篇论文戳破了“自我进化“的滤镜 2024年前后AI圈子里流行起一个说法让大语言模型智能体在执行任务的过程中不断积累经验越用越聪明。这个思路听起来特别自然就像人一样做的事情多了经验就攒起来了下次遇到类似问题就能处理得更好。于是一批叫做自我进化的方法陆续被提出来有的往对话上下文里塞策略有的建立记忆库有的攒一套可复用的技能包。但这里有个问题几乎没人认真问过这些方法是怎么被测试出有效的答案有点尴尬。绝大多数研究的做法是让智能体在同一个基准测试集里反复做题每道题解决完就清空状态重新开始下一道。这种测试方式有个专门的名字叫独立评估。**独立评估每完成一个任务就把智能体的状态清零任务之间互不影响性能是分别算完再求平均的评估方式。**问题就出在这里。真实世界里没有人会把工作任务打包成一个个孤立的单元做完一个就清空脑子重新开始。一个智能体今天可能在处理软件开发的问题明天切换到客服对话后天又要去查资料写报告。任务领域会切换任务之间没有明确的边界提示也没有人告诉它现在开始是新任务了。这种情况下那些在独立评估里表现亮眼的自我进化方法到底还灵不灵没人知道因为几乎没人这么测过。这就是这篇来自微软和中科院自动化所团队的论文要回答的问题。他们搭了一个叫AgentStream的评估框架把这个悬而未决的问题摆到台面上狠狠地测了一遍。测完之后很多原本被默认成立的假设都被推翻了。问题到底难在哪从做题到过日子先说清楚这篇论文测的是什么样的智能体。**自我进化智能体在部署运行期间通过反思自己的执行经历不断更新自身状态比如上下文提示、记忆库、技能库或整套工作框架从而在后续任务中表现得更好的智能体。**这类方法按照更新的对象不同大致分成四类。有的方法改的是提示词上下文也就是喂给模型的那段说明文字有的建立结构化的记忆系统把过去的经验索引起来方便检索有的攒一个技能库把可复用的操作模式打包成模块还有的是整套装备升级把系统提示、工具配置、记忆模块全部打包一起演化。这几种思路都挺合理各有各的道理。但论文作者盯上的不是这些方法本身的设计而是评估它们的方式。他们指出现有的研究基本都是各测各的一个方法配一个基准测试测完出个数字宣布自己比基线好多少。至于换个测试场景会怎样模型能力强弱会不会影响结果几乎没人系统地研究过。打个比方这就像是评价一个厨师的水平只让他在自己最拿手的那道菜上反复练习然后说看他做得很好。可是真实的后厨是什么样的客人点单是随机的川菜、粤菜、西餐轮番上厨师得在不同菜系之间灵活切换还得记住哪些经验是通用的哪些只适用于某道特定的菜。如果一直只在单一菜系里练手你根本无法判断这个厨师碰到今天做完宫保鸡丁下一单是提拉米苏这种情况会不会翻车。如果不做这种混合场景的测试会发生什么答案很直接那些号称自我进化有效的方法可能只是在特定的、单一的测试环境里凑巧表现不错一旦挪到真实的、任务混杂的部署环境效果可能完全崩掉甚至比什么都不做还差。这正是这篇论文想揭穿的地方。AgentStream三种生活方式下的智能体考验AgentStream框架的核心设计思路是把任务流的组织方式做成可配置的通过控制任务来自哪些基准、以什么顺序出现模拟出智能体在部署时可能遇到的各种真实处境。论文里设计了三种测试场景分别叫Isolated隔离、Sequential顺序、Interleaved交织。**Isolated隔离场景每个基准测试维护自己独立的进化状态智能体在这个基准里积累的经验完全不会传给别的基准。**这个场景其实就是传统独立评估的升级版但和普通独立评估不同的是这里智能体在同一个基准内部的多道题目之间状态是持续累积的只是跨基准的经验被完全隔开。**Sequential顺序场景智能体按固定顺序依次处理多个基准比如先做完编程任务再做工具调用再做对话任务……进化状态在基准切换的时候也会保留下来不清空。**这模拟的是一种渐进式的部署场景智能体先在一个领域里练手然后被派去做另一个领域的活儿之前攒的经验有可能帮上忙也可能造成干扰。**Interleaved交织场景来自所有基准的任务被打乱顺序混在一条流水线里随机出现智能体只有一个共享的进化状态需要面对完全没有规律可循的任务切换。**这是最贴近现实混乱程度的场景前一秒可能在写代码后一秒突然要处理一个客服对话再下一秒又跳回浏览网页查资料。三个场景的设计逻辑其实是层层递进地剥离确定性。Isolated测的是智能体能不能在同一领域里把经验用好这是最基本的能力。Sequential测的是有序切换领域时之前的经验是帮忙还是添乱。Interleaved测的是最极端的情况也就是完全无序、无预警的领域跳转智能体能不能靠自己判断哪些经验该用、哪些该扔。论文团队在这三种场景下交叉测试了三个当前最先进的基础模型GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.7配上五种代表性的自我进化方法ACE、A-Mem、ReasoningBank、AutoSkill以及论文团队自己实现的Harness跑在六个覆盖不同能力维度的智能体基准上包括交互式编程任务AppWorld、函数调用测试BFCL、深度网络搜索BrowseComp-Plus、高难度学术推理HLE、真实代码修复任务SWE-bench Verified以及对话协调任务Tau2。这是一次名副其实的排列组合式大考。第一个发现自我进化不是稳赚不赔的买卖先说最基本的一个问题自我进化到底有没有用答案是有条件的有用。在所有测试组合里把智能体从啥都不学的原始基线状态换成自我进化状态正向提升的比例是有的但也有相当一部分场景是负向的也就是学了反而变差了。三种场景里Isolated表现最稳正向命中率达到75.7%平均提升1.37个百分点。而两种跨领域场景Sequential和Interleaved正向命中率都只有62.3%左右提升幅度也明显更小。这里出现了一个反直觉的结果。按照直觉Interleaved任务完全打乱、毫无规律应该是最难的场景理论上应该比Sequential这种有序切换更容易出问题。但实际测出来的结果恰恰相反Interleaved的平均提升是0.90%反而比Sequential的0.75%更高而且在15组模型方法配对里Interleaved有10组胜过Sequential只有5组落后。这个反常现象背后的原因其实和智能体如何调用经验有关后面章节会详细拆解。但先说结论任务打乱得越彻底反而可能倒逼智能体更谨慎地筛选相关经验而顺序切换看似温和却可能让旧领域的经验悄悄污染新领域的判断造成隐蔽的负迁移。**隔离场景是自我进化最靠谱的试炼场跨领域场景中任务彻底打乱的交织场景反而比按顺序切换的顺序场景表现更好尽管前者理论上干扰更大。**第二个发现模型不够强学了也白学这可能是全文最扎心的一个结论自我进化的效果取决于底层模型本身够不够强。数据显示GPT-5.4在所有三种场景下自我进化的平均收益都是负的从-0.35%到-0.78%不等15组测试里只有4组超过了原始基线。反观Gemini 3.1 Pro15组里有14组正向提升收益在1.98%到2.71%之间Claude Opus 4.7则是13组正向收益在0.90%到1.75%之间。这个差异不是偶然在三种场景下都稳定存在。为什么会这样论文给出的解释是自我进化存在一个自举循环智能体做对的任务越多产生的高质量经验就越多这些经验又能帮助后续任务做得更好形成正反馈。但如果基础模型能力不够一开始的成功率就低那么积累起来的经验大多来自失败或者半成功的轨迹从这种噪声里根本提炼不出有用的东西。这就像给一个刚学做饭的新手厨师配一本错误笔记本让他每做一道菜就往里记点心得指望他越记越会做菜。但如果他一开始连基本功都不扎实做十道菜错八道那这个笔记本里记的全是错误的教训甚至会把错误的操作误当成经验固化下来。如果不设置这个能力门槛会怎样答案就是GPT-5.4的表现越学习反而越偏离正轨因为学到的是一堆带噪声的失败样本而不是可靠的成功模式。更微妙的是第二层发现收益和模型能力之间不是线性的而是非单调的。在两个受益于自我进化的模型里Gemini 3.1 Pro的平均收益2.37%居然比Claude Opus 4.71.23%更高尽管在原始基线上Claude是更强的模型。而且这个差距会随着场景复杂度扩大。在Isolated场景里两者的收益差是0.96个百分点到了Sequential场景差距是0.93个百分点一旦进入Interleaved场景差距直接拉大到1.51个百分点。这说明了什么一个已经很强的模型在大多数基准上已经接近天花板能通过学习再挤出来的提升空间自然有限。而一个中等能力的模型还有很大的成长空间混合多样任务带来的经验反而能让它吸收得更充分。这有点像给学霸和中等生同样布置一套跨学科综合练习题学霸原本各科分数都接近满分练习题带来的边际提升有限而中等生原本某些科目比较薄弱综合练习恰好能补上短板进步幅度自然更大。第三个发现选对方法比选对模型更重要而且没有万能公式论文接下来分析了模型能力和方法选择之间的互动关系这里面藏着一个很实用的结论。不同自我进化方法之间的表现差距会随着模型能力增强而收窄。在GPT-5.4上最好和最差方法之间相差5.3个百分点且只有1种方法能超过原始基线到了Gemini 3.1 Pro上差距缩小到2.0个百分点五种方法全部超过基线再到Claude Opus 4.7差距进一步收窄到0.9个百分点各方法表现都挤在一个很窄的区间里且都比基线好。这个趋势可以理解成弱模型的时候方法架构决定生死因为智能体本身能不能从大量失败经验里挖出可用信号很大程度上取决于所用方法的设计是否精巧。而强模型的时候各种方法都能可靠地产生正向迁移方法选择的重要性自然被稀释了。这里还有一个特别值得记住的结论没有一种自我进化方法是放之四海皆准的。A-Mem在GPT-5.4上是表现最好的方法但换到Gemini 3.1 Pro上就排到最后ACE在Gemini上领跑换到另外两个模型上却只能排第三。唯一一个在三个模型上都保持竞争力的是ReasoningBank。**方法选择不能照搬别人的经验同一套自我进化方法在不同模型上的表现可能天差地别必须针对具体模型单独挑选合适的方法。**第四个发现为什么打散反而更聪明前面提到Interleaved场景表现居然优于Sequential这个反常现象的答案藏在不同方法处理经验的方式差异里。论文把五种方法分成两大类一类是上下文集成型比如ACE和Harness它们把积累的经验直接揉进智能体的提示词里成为每次决策的固定背景另一类是检索型包括ReasoningBank、AutoSkill和A-Mem它们把经验存在外部记忆库里遇到新任务时才去检索最相关的那部分调用进来。**检索式方法将积累的经验存放在独立的记忆库中任务到来时通过关键词或语义相似度检索出最相关的条目再注入使用而不是把所有经验一股脑塞进提示词。**数据显示这两类方法在场景偏好上呈现出清晰的分野。上下文集成型方法在Isolated场景表现最好ACE取得2.28%的最高收益而检索型方法则在Interleaved场景达到峰值A-Mem在这种场景下取得2.22%的收益。背后的机制不难理解。上下文集成型方法把经验和执行上下文紧密绑定在单一领域内这种绑定能转化成精准的领域策略反复应用效果很好。但一旦任务流跨越多个领域这种紧密绑定就成了负担来自不相关领域的经验会污染当前决策。数据也印证了这一点ACE的收益在Interleaved场景直接从2.28%跌到-1.26%Harness也从1.91%降到1.01%。反过来检索型方法因为有一道筛选闸门只在决策时调用与当前任务最相关的经验条目这道闸门天然过滤掉了大量不相关的干扰。同时多样化的交织任务流反而给这些方法提供了更丰富的原材料让它们能提炼出跨领域通用的模式。这个道理其实很像图书馆的两种藏书方式。一种是把所有笔记直接抄在一本随身携带的手册里走到哪带到哪遇到问题直接翻阅速度快、上手方便但如果你频繁在完全不相关的领域之间切换这本手册会被越攒越厚、越来越杂乱甚至可能把上一个领域的笔记误用到当前场景里。另一种是把所有笔记归档进一个大型索引系统需要时输入关键词精准检索虽然多了一步查找的功夫但只要索引系统设计得当即便面对成千上万条不同领域的笔记也不会互相干扰。如果任务始终局限在同一个领域第一种方式的即取即用优势更明显一旦任务开始频繁跨界第二种方式的筛选能力就成了决定性的优势。顺手看看成本自我进化会不会更烧钱论文还专门算了一笔经济账这一点在很多同类研究里常常被忽略。结果显示自我进化并不必然意味着更贵。在Gemini 3.1 Pro上四种方法的实际成本反而低于原始基线ReasoningBank把成本压到基线的64%Harness压到71%AutoSkill是82%A-Mem是84%。这些方法同时还减少了智能体完成任务所需的平均步数说明积累的经验确实帮智能体更高效地找到了解题路径。但在GPT-5.4上情况反了过来。大多数方法成本明显上升A-Mem的成本一度飙到基线的577%ACE也达到266%只有ReasoningBank一枝独秀把成本压到基线的92%。结合前面提到的能力门槛结论这个成本差异其实很好理解。GPT-5.4本身效果收益就是负的弱模型攒的经验质量不高智能体不但没学到有用的东西反而可能因为反复试错、绕弯路而消耗更多算力赔了夫人又折兵。而Gemini 3.1 Pro因为能有效吸收经验经验反过来指导它走更少的弯路省时又省钱。三个模型的学习性格迥异论文还深挖了三个模型在自我进化过程中积累状态的具体差异这部分揭示了一件很有意思的事不同的大模型学习风格差别很大就像不同的学生记笔记的方式完全不一样。Claude Opus 4.7攒的经验体量最大平均能生成1251条ACE策略条目Harness技能库里的技能数量能到463个。Gemini 3.1 Pro则相反攒的状态最精简ACE条目只有209条AutoSkill技能只有117个但每条内容更浓缩。GPT-5.4则介于两者之间。更有意思的是Claude在使用Harness方法时几乎把所有精力都花在扩充技能库上系统提示和记忆部分只维持了9千字符左右而Gemini恰恰相反把大量篇幅约2.9万字符投入到集中化的系统提示和记忆里技能条目相对更少。这说明Claude偏爱把经验拆解成一个个具体可复用的技能模块而Gemini偏爱把经验浓缩成一份精炼的操作指南。在更新行为上三个模型也各有各的脾气。GPT-5.4几乎是只增不改300个任务里只对已有技能做了5次修订系统提示一次都没动过Gemini 3.1 Pro的更新分布更均匀记忆和系统提示改了267次技能修订了66次而Claude Opus 4.7最为勤快在96%的任务后都会进行修订而且几乎全部集中在打磨技能库上。这种差异有点像三种不同性格的员工写工作日志。有人从不回头修改旧记录只顾往前添加新内容有人喜欢定期整理归纳把零散信息浓缩成精炼的操作手册还有人几乎每天都要回头翻修昨天写的内容力求每条记录都尽善尽美。三种风格没有绝对的优劣但确实会影响最终积累出来的知识体系是庞大而细碎还是精炼而集中。写在后面读完这篇论文最让人意外的地方不是自我进化有时候没用这个结论本身而是它揭示了一个更深的评估陷阱一个方法在孤立测试里表现优异完全可能是因为测试环境天然规避了它的弱点而不是因为这个方法真的鲁棒。这让我联想到软件测试里的一个老问题。单元测试全绿不代表系统上线不出事因为单元测试往往是在理想化的隔离条件下跑的真实生产环境里各个模块之间会互相影响会有你没预料到的边界情况。AgentStream这篇论文本质上是在给自我进化智能体做集成测试而不是停留在单元测试层面这个视角的转变本身就很有价值。还有一处细节值得单独说一说Interleaved场景居然比Sequential更友好这个结果一开始我也觉得反直觉但仔细想想顺序切换其实制造了一种虚假的连续性让智能体误以为前一个领域的经验依然适用而彻底打乱的任务流反而逼着智能体时刻保持警惕去主动判断这条经验和当前任务到底相不相关。有时候看起来更混乱的环境反而会倒逼出更谨慎的行为。这个道理或许不只适用于AI智能体。如果自我进化的收益真的严重依赖底层模型能力那么随着基础模型持续变强未来是不是所有自我进化方法都会趋同变得同样有效还是说会出现新的能力天花板让方法选择重新变得重要这个问题这篇论文没有给出答案但已经把探照灯打到了对的地方。QAQ1AgentStream是什么AAgentStream是一个统一的评估框架用来测试大语言模型智能体在流式任务场景下的自我进化能力通过Isolated隔离、Sequential顺序、Interleaved交织三种测试场景系统评估不同基础模型和自我进化方法组合的实际表现而不是像以往那样只在孤立、单一的任务上做测试。Q2自我进化智能体一定比不学习的智能体表现更好吗A不一定。论文发现自我进化的效果高度依赖底层基础模型的能力能力较弱的模型如GPT-5.4在三种测试场景下都出现了负收益也就是学了反而变差而能力较强的模型如Gemini 3.1 Pro和Claude Opus 4.7才能稳定获得正向提升且收益与模型强弱并非线性关系。Q3哪种自我进化方法最好用A论文发现没有一种方法能在所有模型和场景下都表现最优。上下文集成型方法如ACE、Harness更适合任务领域单一的场景检索型方法如ReasoningBank、AutoSkill、A-Mem更适合任务领域混杂交织的场景而且最优方法会随着搭配的基础模型不同而变化建议针对具体模型单独选择合适的方法。
返回列表