
期望越高失望越大ChatGPT 为何总被骂“降智”如果你混迹于 AI 社区一定见过这样的场景ChatGPT 偶尔回答得不够完美评论区立刻炸锅满屏都是OpenAI 又降智了”、“模型被偷偷替换了”的指责。然而当隔壁的 Gemini 犯下同样的逻辑错误或者给出一个平庸的回答时舆论却往往温和得多甚至有人会觉得“谷歌这次表现还行”。这真的只是因为 ChatGPT 的技术实力下滑得比对手快吗未必。很多时候这种强烈的反差并非源于模型能力的绝对值变化而是用户心理预期与产品定位错位的结果。当我们剥离掉技术术语从用户体验和心理学的角度去审视会发现 ChatGPT 其实是被自己曾经的辉煌“坑”了。被“神化”的历史包袱95 分掉到 80 分的落差感人对事物的评价从来不是基于绝对的分数而是基于变化的幅度。回想 2022 年底ChatGPT 横空出世时它给整个世界带来的震撼是前所未有的。那是很多人第一次意识到原来机器真的可以像人一样对话、写代码、做分析。在那个阶段用户对它的容忍度极高只要它能跑通一段代码或写出一篇通顺的文章大家就会惊呼AI 太神奇了”。正是这种早期的惊艳表现将用户的心理阈值拉到了一个极高的位置。在大家的潜意识里ChatGPT 就应该是一个无所不能的“超级大脑”理应永远保持 95 分甚至 100 分的状态。这就带来了一个残酷的心理效应当一个长期考 95 分的优等生突然有一次只考了 80 分周围人的第一反应绝不是“他还在及格线以上”而是“他怎么了是不是退步了”相比之下Gemini及其前身 Bard在早期给人的印象相对平淡甚至因为一些滑稽的错误而被贴上“不够聪明”的标签。用户的初始预期可能只有 60 分或 70 分。因此当 Gemini 做出一个 80 分的回答时用户的感受是“哇它进步了”而不是“它怎么变笨了”。同样的输出质量放在两个不同的产品身上得到的评价却截然相反这就是锚定效应在作祟。ChatGPT 输在了它曾经太优秀导致任何微小的波动都被放大成了“事故”。付费用户的严苛契约花钱买的是“确定性”另一个不可忽视的因素是付费模式带来的心理契约。ChatGPT 拥有庞大的 Plus 和 Pro 付费用户群。对于这部分用户而言每月支付的订阅费不仅仅是一个数字更是一份对服务稳定性的隐性契约。付费用户的核心诉求不仅仅是“强大”更是“稳定”和“可预测”。想象一下你去一家人均 500 元的高级餐厅。如果第一次去味道惊艳你会觉得物超所值但如果第二次去发现菜品口味忽咸忽淡甚至服务员响应变慢你的愤怒值会远高于去一家平价快餐店遇到同样情况。在快餐店你可能心想“反正便宜凑合吃吧”但在高级餐厅你会觉得“我花了这么多钱凭什么体验变差了”ChatGPT 的付费用户正是处于这种心态。当他们发现昨天还能完美解决的复杂逻辑题今天突然变得含糊其辞或者代码生成频繁出错时那种“被背叛感”会迅速转化为对“降智”的指控。他们无法接受付费后服务质量的非线性波动。反观 Gemini虽然也有高级版本但在大众认知中其免费版的覆盖面更广且很多用户并未将其作为核心生产力工具深度绑定。使用频率低、依赖程度低自然也就少了一份“必须完美”的苛责。很多时候用户甚至察觉不到 Gemini 的细微波动因为它压根就没进入用户的高频工作流。行业基准的诅咒被拿着放大镜对比的“公敌”ChatGPT 还有一个特殊的身份行业基准Benchmark。在 AI 领域几乎所有的新模型发布第一件事就是拿 ChatGPT 来“祭旗”。开发者们习惯用一套固定的测试题Prompt先问一遍老版本的 GPT-4再问一遍新模型甚至过几天再问一遍现在的 ChatGPT以此来验证优劣。这种全行业的“找茬”行为让 ChatGPT 处于一种极度透明的审视之下Claude 出来了大家拿 ChatGPT 比Gemini 升级了大家拿 ChatGPT 比就连 ChatGPT 自己出了新版本大家还要拿它和半年前的旧版本比。在这种高强度的横向与纵向对比中任何一点因模型路由策略调整、上下文窗口限制或临时算力波动导致的体验差异都会被无限放大。用户并不关心后台是 MoE 架构的动态调度问题还是 System Prompt 的膨胀导致了“对齐税”他们看到的直观事实就是“昨天能行今天不行肯定是降智了。”而 Gemini 由于尚未完全成为所有人的“主力军”很多人一周可能只用它一两次。这种低频使用就像备用手机电量掉了 20% 可能半个月都发现不了。缺乏高频的深度交互自然就少了那些关于“状态不稳定”的敏锐吐槽。理性看待波动是“变笨”还是“策略调整”当我们理解了上述心理机制或许能对所谓的“降智”多一份理性。大模型本质上是一个概率系统而非确定性的计算器。同一个问题受限于当前的服务器负载、动态路由策略比如为了节省算力将简单问题分发给小参数模型、以及安全过滤层的实时调整输出结果出现波动是技术上的常态。很多时候并不是模型真的“变傻”了而是产品在商业化、合规性与性能之间做出的动态平衡。例如为了应对海量的并发请求系统可能会在某些时段自动降低推理的深度或者为了符合新的安全规范模型被注入了更严格的系统指令导致回答变得保守。对于用户而言意识到**“期待值管理”**的重要性至关重要。如果你将 ChatGPT 视为一个永远完美的神那它每一次呼吸不均匀都会让你失望但如果你理解它是一个复杂的、正在演进中的工程产品接受它在极端场景下的不稳定性或许能减少很多无谓的焦虑。至于 Gemini它目前的“宽容待遇”或许只是因为它还未真正承担起数亿用户核心工作流的重任。一旦有一天它真的成为了程序员每天写代码、分析师每天处理数据的首选工具并且开始大规模收费相信届时关于它“降智”的讨论也不会比今天的 ChatGPT 少多少。毕竟被批评往往是因为被需要而被依赖才最容不得沙子。