ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

Havenlon | 杂谈:AI 时代,那个《黑天鹅》式的问题正在变得更重要

Havenlon | 杂谈:AI 时代,那个《黑天鹅》式的问题正在变得更重要 纳西姆·尼古拉斯·塔勒布在《黑天鹅》中讲过一个著名的“火鸡问题”。一只火鸡每天都会得到主人的喂养第一天如此第一百天如此第五百天依然如此。随着时间推移如果这只火鸡会做统计它会发现一个无比稳定的规律主人每天出现随后带来食物过去的样本越多这条规律看起来就越可靠。到了第一千天火鸡对这个世界的信心甚至可能达到顶点因为它已经积累了足够多的历史数据来证明“人类是来照顾我的”。可真正讽刺的是它最相信这条规律的时候可能恰恰距离感恩节最近。这个故事真正讨论的不是火鸡而是人类一个极其顽固的认知习惯我们总是倾向于把“过去没有发生”逐渐理解成“未来不会发生”。今天当 AI 从一个回答问题的工具逐渐变成能够调用 API、访问数据库、操作云资源、发送邮件、执行支付甚至连接现实设备的 Agent 时这个古老的问题正在以一种新的方式重新出现。一、真正危险的可能不是 AI 经常犯错而是它长期不犯错假设一家企业刚上线一个 AI Agent。最初阶段所有人通常都会非常谨慎它只能读取信息不能直接修改数据高风险操作需要人工确认转账有明确限额删除操作需要额外审批所有执行都有完整记录。然后 Agent 连续运行一个月没有严重问题半年以后已经成功完成几十万次任务一年以后甚至成为业务流程里最稳定的一部分。于是原本合理的安全边界开始被重新审视既然每一次人工确认最终都是“同意”为什么不能取消既然 Agent 从来没有滥用过权限为什么不能开放更多工具既然过去十万次执行都没有严重错误为什么还要让它在关键步骤停下来等待额外检查从效率角度看这些问题都很合理甚至每一步都有历史数据支持但这恰恰也是火鸡理解世界的方式。过去一千次有人喂食于是第一千零一次似乎也应该如此Agent 过去十万次执行正确于是第十万零一次似乎也应该正确。真正危险的地方并不只是这种推断可能失败而是过去的成功会不断改变我们愿意给系统多少权力。随着信任增加人工确认减少权限扩大执行范围延伸原本存在的隔离逐渐被视为低效率和历史包袱。因此一个非常反直觉的风险出现了AI 越稳定我们越愿意撤掉限制AI 越可靠我们越愿意扩大它的执行半径而真正错误发生时它能够造成的后果反而可能比最初更大。长期成功本身可能成为制造脆弱性的过程。二、99.99% 的正确率不能回答最重要的问题现代技术世界特别喜欢准确率、成功率和可用率。当一个 Agent 的任务成功率达到 99.9% 或 99.99% 时人们很自然地会把这个数字与“安全”联系在一起。但在高风险执行系统里这种平均值往往不能回答最重要的问题因为不同错误的后果并不是线性的。一个 AI 助手答错一道普通问题代价可能只是用户重新问一次一个 Agent 发错一封内部邮件也许只是一次沟通事故。但如果同一个系统拥有生产数据库删除权限、企业资金支付能力或关键设备控制接口那么一次错误就可能造成完全不同量级的损失。前 99999 次操作都正确最后一次误删了生产数据从统计意义上看系统依然接近完美可对于企业而言这个平均值可能已经没有多少意义。这也是《黑天鹅》中最值得重新理解的地方之一在某些领域一个极端事件足以压过大量正常样本。AI Agent 越来越接近这样的世界它的真正风险不一定来自“经常犯错”而可能来自一次低概率、不可逆、具有巨大外部性的执行。所以当 AI 开始拥有改变现实的能力以后我们真正应该问的不只是“它平均有多可靠”而应该增加另一个问题它最坏的那一次能够走多远前一个问题关注正确率后一个问题关注错误的影响半径。模型当然应该越来越可靠但如果所有安全信心最终都建立在“模型已经足够可靠所以可以取消边界”上我们只是换了一种方式重新犯火鸡的错误。三、事故能够被解释不代表事故能够被预测另一个常见错觉是把事后解释能力误认为事前预测能力。金融危机发生以后人们可以回头指出杠杆率、流动性和资产泡沫系统故障发生以后工程师可以在日志里找到几小时前已经异常的指标AI Agent 越界以后我们也可以重新检查 Prompt、上下文和工具调用链然后指出某个时刻其实已经出现了风险征兆。这些分析当然有价值但它们很容易带来一种过度自信既然事故发生以后能够找出原因那么下一次只要监控得更聪明、模型看得更多、异常检测做得更细就应该能够提前发现同类问题。问题在于事后解释和事前预测从来不是同一种能力。一个异常指标在事故发生以后看起来非常明显在事故发生以前却可能只是大量噪声中的一个一种 Agent 行为事后看起来明显越界当时却可能与普通探索行为没有本质区别。因此AI 安全不能把最后一道防线全部建立在“我们一定能够提前看懂它什么时候要犯错”这个假设上。真正重要的问题应该变成如果有一天我们没有提前发现系统还能不能承受这正是预测和控制之间的区别。预测试图告诉我们未来会发生什么而控制承认我们可能无法知道未来却仍然可以限制未来能够造成什么后果。我们不知道 Agent 下一次会不会误判但可以限制单次支付金额不知道哪一种上下文会被污染但可以规定某些生产对象不能被单一主体直接删除不知道哪一种未知状态第一次出现但可以让缺失、冲突和不确定本身成为拒绝继续执行的理由。不能预测错误不等于不能限制错误。四、真正侵蚀安全边界的往往不是失败而是成功安全机制有一个天然困境如果它长期有效人们反而很难感受到它的价值。消防通道绝大多数时间没有人使用备用电源可能几年都不会真正启动一个最终否决机制也许连续数年都没有拒绝过一次执行。于是从组织效率的角度看这些东西很容易逐渐变成“低利用率资产”。如果三年都没有触发为什么还要维护如果 Agent 从来没有误操作为什么还需要这个限制如果人工审批每次最终都是同意为什么不能取消问题在于这种逻辑把“事故没有发生”和“防止事故的机制没有价值”混成了一件事。现实中经常恰恰相反长期没有出现严重后果可能正是因为那些看起来低效、保守、冗余的机制一直存在。于是安全会形成一种微妙的悖论成功会逐渐侵蚀产生成功的条件。事故少了预算开始削减边界很少被触发边界开始被取消人工极少否决 Agent于是人工被视为可以自动化掉的最后摩擦。直到第一次真正不同于过去的问题出现人们才重新问为什么当初没有留下最后一道保护对于 AI 系统而言真正危险的时刻也许不是它表现很差的时候而是它已经表现得足够好让组织开始相信那些原本用于限制极端错误的机制已经没有必要的时候。五、AI 系统真正需要为“第 100001 次”设计今天的大部分 AI 优化都在努力改善前十万次执行让模型更聪明、更稳定降低幻觉提高任务成功率让工具调用更加准确。这些工作当然重要但一个真正进入高风险现实系统的 Agent还必须为另一个数字设计——第 100001 次。那一次可能来自一种训练数据里没有出现过的组合可能是两个原本安全的系统发生意外交互也可能是环境状态突然变化或者某个很小的理解错误被高速自动化放大。更重要的是那一次问题发生以前可能没有任何人能够清楚解释它为什么危险。一个成熟系统的价值应该在这里体现出来。它并不承诺 AI 永远不会犯错而是保证某些错误即使真的发生也无法无条件穿透所有边界。这并不是只属于 AI 的新思想我们无法保证司机永远不犯错所以汽车有刹车、护栏和安全气囊无法保证电网永远正常所以有断路器无法保证建筑永远不失火所以保留消防通道。它们的共同点不是能够提前预测下一次事故而是承认事故终究可能发生因此提前限制事故可以造成的最大后果。AI Agent 最终也需要进入这样的工程阶段安全不能只停留在证明模型越来越值得信任而应该进一步保证即使模型在绝大多数时候都值得信任系统也不会把所有现实变化的权力集中在某一次判断之上。六、《黑天鹅》真正教我们的不是如何预测下一只黑天鹅很多人读完《黑天鹅》以后本能地会问既然黑天鹅如此危险那我们怎样找到下一只黑天鹅但真正重要的并不是成为一个越来越厉害的预言家而是接受一个不太舒服的事实世界里始终存在一些我们看不见、算不到也无法提前解释清楚的东西。成熟并不意味着越来越确信自己能够预测未来而是知道即使预测失败系统也不能因此失去全部边界。今天的 AI 正在获得越来越强的能力它们能够理解更长的上下文、规划更复杂的任务也越来越能够直接参与真实世界执行。但能力越强我们越容易产生另一个危险的心理既然它已经这么可靠也许那些限制可以慢慢取消既然十万次都没有出事也许下一次不用再检查既然模型越来越聪明也许最终只需要相信模型本身。《黑天鹅》真正令人不舒服的提醒就在这里过去不断重复的事实只能证明过去它不能替我们消灭未来的未知。所以真正成熟的 AI 系统不应该以“终于造出了一个不会犯错的智能”为最终目标。更现实、更重要的目标是即使它在最意外的那一次犯了错我们仍然没有把全部现实交给它。安全边界的价值也从来不应该通过它平时触发了多少次来衡量。它存在的意义是为那个我们无法提前指出时间、无法预先描述形式、甚至今天根本还想不到的“第 100001 次”留下空间。《黑天鹅》真正提醒我们的从来不是如何准确预测下一次意外而是不要因为暂时看不见意外就把承受意外的能力一起拿掉。AI 时代我们正在重新面对这个古老的问题。不同的是这一次我们所信任的系统已经不只是越来越会判断它也正在越来越有能力直接改变现实。
返回列表