ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

8个AI替代不了的能力,程序员的保命清单

8个AI替代不了的能力,程序员的保命清单 8个AI替代不了的能力程序员的保命清单AI代码冲击波系列 第11篇 | 突围篇作者AI_easygo系列导航本系列共12篇分3个PhasePhase 1 冲击篇01-04AI裁员潮 → 裁员回旋镖 → Agent删库事故 → Clinejection提示注入Phase 2 暗面篇05-08Vibe Coding翻车 → 70%墙 → 提示注入武器化 → 裁员悖论Phase 3 突围篇09-12从码农到AI编排师 → Devin实测 →8个保命能力本篇→ AI时代铁饭碗前篇回顾第10篇用Devin这个最成熟的自主编程Agent做了实测。SWE-bench第7名和Mercedes-Benz 30倍压缩同时为真。Devin在定义明确的任务上能消化大量机械工作在需要判断的任务上几乎碰不到。结论是Devin能取代你吗本身是个错误的问题正确问法是你做的工作有多少Devin能做。本篇接着回答后半句你该把时间投到哪些AI做不了的地方。一、保命逻辑从写得出到判得准先看一个反直觉的实验。Anthropic在2026年1月发了一篇研究arXiv:2601.20245自己给自己的产品泼了一盆冷水。研究团队找了52名有经验的Python程序员让他们学习一个全新的异步编程库Trio。一半人可以用AI助手另一半只能看文档和搜索引擎。实验结束后的技能测试结果用AI的那组平均得分比手写组低了17个百分点。分差最大的领域是调试能力。更耐人寻味的是AI组完成任务的速度并没有显著提升。用了AI你既没变快理解还变差了。研究团队把参与者的AI交互模式分成六类。三类保持了良好学习效果共同点是保持主动认知参与比如主动问概念性问题、要求AI解释生成的代码。三类导致学习效果显著下降共同点是把AI当代写工具直接复制粘贴不关心代码原理。主动探究模式的人得分65%以上被动委托模式的人只有35%。中间差了30个百分点。这个实验戳破了一个幻觉用AI写代码不等于掌握了代码。AI帮你把代码写出来了你对这段代码的理解可能比从头自己写还差。1.1 EvoClawAI会盖楼不会维护楼Anthropic的实验在个体层面验证了理解退化。在系统层面一个叫EvoClaw的基准测试给出了更硬的证据。EvoClaw由南加州大学、加州大学河滨分校、斯坦福、普林斯顿和OpenHands联合发布arXiv:2603.13428。它和传统的SWE-bench有一个根本区别SWE-bench给你一个失败测试你打个patch让它通过就完了平均涉及1到2个文件。EvoClaw让AI在同一个代码库上连续完成数十个相互依赖的功能迭代每个迭代的产出都是下一步的起点横跨Python、Java、Go、Rust、TypeScript五种语言最长真实开发周期达750天。结果是一条悬崖。模型独立任务得分EvoClaw持续演进得分Claude Opus 4.680%以上38.03%GPT 5.3 Codex80%以上28.88%Gemini 3 Pro80%以上完整解决率仅13.37%80%到90%的独立任务得分到了持续演进场景里集体腰斩。研究团队把分数拆成两个维度召回率功能实现完备性和精确率新增功能时破坏既有代码的程度。结论非常清晰召回率几乎线性上升AI一直在加新功能。精确率是真正的瓶颈回归错误积累的速度超过修复速度。一句话概括AI一直在盖楼但楼越来越歪最后自己把自己盖塌了。研究团队给这个现象起了个名字叫技术债破产technical debt bankruptcy。用饱和函数外推即便是最强的Opus 4.6累计分数也会卡死在45%左右的渐近线上。给再多时间过不去。1.2 保命能力的本质把Anthropic的个体实验和EvoClaw的系统实验放在一起保命逻辑就清楚了。AI的强项是召回率是从零到有是生成新代码。AI的弱项是精确率是在已有架构上做正确修改是判断、维护、理解。Anthropic自己也承认这一点。2026年6月发布的《When AI builds itself》报告披露Claude写了Anthropic代码库80%以上的代码工程师每天merge的代码量是2024年的8倍。但报告同时把工作分成两半执行写代码、跑训练和判断决定做什么、怎么解读结果。AI在执行层面已经接近甚至超过人类在判断层面人类仍有优势。这个优势正在被侵蚀但还没被追平。保命能力的本质就是守住AI召回率上不去的那部分判断、维护、理解、安全、对齐。下面这8个能力全是精确率的不同表现形式。二、8个能力清单能力1问题定义WhatAI为什么做不了AI擅长回答问题。它不知道哪些问题重要。判断这个需求值不值得做需要理解真实用户需求、架构约束、业务优先级。这些信息散落在产品文档、客户访谈、竞品分析、老板的半句话里。AI能扫描这些文本但做不了优先级排序因为它不承担做错决策的商业代价。JetBrains在2026年做了一项覆盖600多名开发者的研究Olga Bedrina主导。结论里有一条很刺眼AI工具的首要失败点排在第一的不是幻觉是缺乏上下文和对复杂代码理解有限。AI连上下文是什么都需要人来喂它更不可能知道哪个上下文最重要。怎么练每接到一个需求先写一页问题定义文档这个需求解决谁的什么痛点不做会怎样做了能提升哪个指标练习把模糊需求拆成可独立描述、独立实现、独立测试的子问题定期和产品经理、客户坐在一起听他们怎么描述痛点而不是等需求文档传到你手上能力2价值判断WhyAI为什么做不了AI生成代码但不理解客户的业务。它能给你10种技术方案告诉你每种方案的实现成本。它不知道哪种方案你的CFO会批准哪种方案会在合规审查时被卡住哪种方案上线半年后会因为某个没考虑到的业务场景翻车。价值判断的核心问题是什么可以不做。AI的默认倾向是给你更多因为训练数据里完整实现比克制设计多得多。工程上最贵的代码往往是写错了方向的代码。本系列第05篇的Moonwell事故就是活教材。Claude生成的代码少乘了一个汇率直接亏掉178万美元。AI能写出能跑的代码判断这个价格合不合理这件事AI做不了也不该交给AI做。怎么练每个技术决策附带一句商业代价选A方案服务器成本每月多X元选B方案合规风险是Y练习最小可行方案思维这个功能砍到什么程度还能解决核心痛点读公司的业绩报告和所在行业的经济模型理解你的代码跑在什么商业逻辑上能力3系统架构设计AI为什么做不了AI擅长局部推理这个函数做什么弱于全局推理这个服务如何与另外三个服务加缓存层加遗留数据库在负载下交互。EvoClaw已经给出了最硬的量化证据。独立任务上80%以上的模型在需要跨文件、跨服务、跨版本保持一致性的持续演进场景里得分腰斩到38%。召回率一路涨精确率一路跌。AI一直在加功能一直在破坏已有功能。本系列第06篇引用的SWE-EVO测试arXiv:2512.18470指向同一个结论。GPT-5.4配合OpenHands在SWE-bench Verified上能到72.8%到了需要多文件持续推理的SWE-EVO上只有25%。将近50个百分点的断崖。架构能力的本质是全局推理。十个服务如何正确交互缓存层在高峰时怎么表现十八个月前那个看似多余的检查为什么存在因为生产环境发现过一个竞态条件。这些东西没有写在任何一个文件里它活在团队的经验和系统的时间线里。AI每一次交互都从零开始它没有记得上次讨论的能力。怎么练读《Designing Data-Intensive Applications》这类经典看大型开源项目的架构决策记录主动参与公司的架构review自己写design doc哪怕没人审练习演进式升级而非推倒重写在一个运行了三年的系统上加一个风控规则怎么加才不破坏现有契约能力4安全审查与威胁建模AI为什么做不了AI生成代码继承训练数据的漏洞。Veracode扫描了100多个大模型、400万次以上45%的AI生成代码含OWASP Top 10安全漏洞。XSS漏洞的通过率只有15%是所有类别里最差的。更大的模型并不比小模型安全。这是结构性的不是版本问题。CodeRabbit分析了470个真实PRAI参与的PR平均10.83个问题人工PR平均6.45个。最刺眼的是跨站脚本漏洞XSSAI代码是人类代码的2.74倍。AI在生成一个React组件时优化的是这段代码能不能跑对这段代码安不安全毫不关心。用户输入不做消毒就渲染查询参数不做校验就流入DOM操作。威胁建模需要的是一种健康偏执看一眼就能察觉潜在的注入点、不安全的反序列化、缺失的访问控制。这是一种对抗性思维你要假设所有人都在试图攻击你的系统。AI的训练数据里正常工作的代码远多于防御攻击的代码它的默认倾向是信任输入不是怀疑输入。怎么练系统学一遍OWASP Top 10在你常用的语言里掌握对应的防御模式每次审查AI生成的代码先用一张安全检查清单过一遍输入消毒、权限校验、错误信息泄漏、依赖来源练习威胁建模给你的模块画一张数据流图标出每个外部输入点假设每个点都可能被攻击能力5上下文工程AI为什么做不了AI的质量受限于上下文的质量。给它垃圾上下文它产出垃圾代码。给它精准的上下文它能产出接近人类的代码。JetBrains那项600多人的研究把缺乏上下文列为AI工具的首要失败点。问题在于谁来架构这个上下文谁来决定AI需要哪些信息、何时需要、如何组织这件事AI自己做不了因为它没有关于你项目的全局知识。Anthropic在2026年Agentic Coding Trends Report里把上下文工程称为2026年的承重技能the load-bearing skill of 2026。报告里的数据有高质量context文件的团队任务完成速度快55%错误减少40%。上下文工程不是写文档是给AI搭操作系统。怎么练为每个项目写一份CLAUDE.md或.cursorrules项目概述、命令、架构、编码规范、边界约束用MCP协议把代码库、文档、数据库schema连接到AI让它能主动检索而非靠你手动喂把团队的最佳实践沉淀成可复用的Skills文件让AI每次都从团队经验出发而非从零开始能力6多Agent编排AI为什么做不了2026年一个项目配一个AI助手已经不够了。真正的变化是多Agent并行一个构建认证系统一个设置邮件服务一个重构API层一个更新文档。Gartner的数据显示多Agent系统的咨询量从2024年Q1到2025年Q2激增1445%。57%的企业已经部署了多步骤Agent工作流。但多Agent系统有41%到86.7%的失败率79%的失败来自架构设计。编排能力包含三个层次任务分解把实现通知系统拆成6个独立子任务、Agent分配哪个Agent做什么、协调与冲突解决Agent A的输出和Agent B的输出有冲突谁来拍板。这三个层次都是人的判断力延伸到机器上。AI能执行任务管不了自己。本系列第09篇引用的Anthropic数据开发者60%的工作用了AI但完全委托给AI的任务仅占0到20%。这中间的40到60个百分点就是编排工作的内容。怎么练练习任务分解拿一个中等复杂度的需求试着拆成能并行执行的子任务每个子任务有明确的输入输出和验收标准建立Agent分工矩阵哪个Agent擅长什么、失败模式是什么、需要什么上下文在冲突解决中积累判断力当两个Agent的输出矛盾你来读两边代码并决定保留哪个能力7领域专业知识AI为什么做不了AI能读HIPAA的合规文档不能替你承担合规责任。AI能写金融风控的代码不能替你在监管审查时签字。AI能生成工业控制的逻辑不能替你在生产线停机时背锅。领域知识的壁垒AI绕不过去。医疗合规、金融监管、工业控制、数据隐私这些领域有大量不成文的规则、历史踩过的坑、监管机构的偏好这些东西不在公开训练数据里在从业者的脑子里和行业的肌肉记忆里。“深度领域专家加AI熟练度的组合正在成为最有价值的技能叠加。PwC的2025年全球AI岗位晴雨表显示AI技能工人的工资溢价达到56%上一年是25%。Metamindz的招聘数据2026年美国Agent相关岗位发布量同比增长280%但拥有真实生产环境多Agent编排经验的工程师少到几乎不存在”。通用编程的门槛被AI拉平了。领域知识的门槛AI一个都没动。怎么练选一个垂直领域扎进去医疗、金融、制造、物流、教育选一个和你的兴趣或行业背景匹配的读这个领域的法规和标准HIPAA、PCI-DSS、ISO 27001、等保2.0理解每条规则背后的风险场景在这个领域里积累踩坑故事每个事故都是一份别人花钱买来的领域知识能力8沟通与stakeholder管理AI为什么做不了AI不能跨团队对齐需求。它不能坐在会议室里听产品经理讲一个模糊的想法然后用三个问题把它变成一个可执行的技术方案。它不能向高管解释为什么这个技术tradeoff不可接受为什么延期两周比上线一个有安全漏洞的功能更划算。它不能在跨团队资源争夺中替你争取优先级。2026年一项针对资深工程师的调查显示67%的资深工程师认为AI工具无法替代人类开发者。被反复提及的理由就是沟通、协作、复杂问题解决这些软能力。沟通能力随AI普及变得更稀缺更值钱。AI让模块实现变快了模块之间的接口对齐、优先级排序、资源分配仍然是人的工作。随着速度提升这些协调工作变得更紧迫不是更轻松。本系列第08篇提到的Atlassian反转CEO在2025年10月承诺增招2026年3月裁了1600人其中900多研发。留下来的工程师被要求的核心能力之一就是更强的跨团队协调能力。裁员裁的是只会写代码的人留下的是能对齐、能判断、能兜底的人。怎么练练习把技术语言翻译成业务语言向非技术同事解释你的技术决策直到他们能复述核心逻辑主动参与跨团队会议哪怕只是旁听积累对其他团队约束和优先级的理解建立stakeholder地图每个决策影响谁、谁需要提前知会、谁有否决权三、辩证看待3.1 这8个能力不是新技能是被重新定价的旧技能问题分解、系统架构、代码审查、沟通对齐这些是软件工程几十年来一直存在的技能。AI没有创造它们AI只是改变了它们的市场价。以前写代码快的人值钱因为产能瓶颈在写。现在判断代码好坏的人值钱因为产能瓶颈从写移到了判断。8个能力里没有一个是因为AI才出现的它们是被AI从加分项重新定价成了保命项。3.2 真正的风险不是AI是被动使用AIAnthropic那个52人的实验给出了最精准的警示。同样是用AI主动探究的人得分65%以上被动委托的人只有35%。差距不在AI在用法。被动委托的典型表现让AI写完整功能不问为什么这么写不要求解释直接复制粘贴到代码库里。短期看产出很快长期看理解在退化。等遇到线上复杂问题AI解决不了你自己也解决不了因为这段代码从一开始就没进过你的脑子。EvoClaw的技术债破产在系统层面复现了同一个机制。AI一直加功能召回率涨一直破坏已有功能精确率跌最后系统失控。如果你是那个被动委托的人你就是那个一直在跌精确率的系统。3.3 窗口在收窄precisionaiacademy在2026年的分析里有一句值得记住的话成为AI-proof的窗口在收窄大约12到18个月后关闭。这不是说18个月后这些能力就不值钱了。是说18个月后大量开发者会意识到这些能力值钱并开始补课早期红利会被摊薄。现在投入你领先一个身位。18个月后投入你和所有人一起跑。Anthropic自己在《When AI builds itself》报告里也承认判断层面的优势正在被侵蚀。Opus 4.5在研究岔路口找到比人类更优路径的比例是51%半年后的Mythos Preview升到64%。这条线在往上走。你守住的那8个能力每一个都有一条AI在追的线。你能做的是让自己跑在AI追上之前。3.4 乐观中的清醒这8个能力能保命有几个前提需要清醒认识。第一Anthropic的实验存在选择性偏差。报告的案例来自Claude Code的重度用户他们砍79%时间不代表所有人都能砍。你团队里的20%可能还是10%。第二AI技能工资溢价56%意味着这个市场的供给严重不足但供给正在跑步追赶。今天值钱的领域专家加AI组合三年后可能变成标配。第三8个能力里有几个上下文工程、多Agent编排是新兴能力方法论还在形成中。现在投入的人是在帮行业探路探路有风险也有先发优势。第四也是最重要的本系列第08篇拆解过4.5%的真实替代率说明AI裁员叙事跑在技术现实前面。同样8个保命能力的叙事也跑在大多数程序员的日常现实前面。你今天的工作大概率还是写代码。但能保你活到明天的大概率是这8个能力里的某几个。四、保命清单速查表一张可以截图保存的表。左边是能力中间是AI为什么做不了右边是怎么开始练。能力AI为什么做不了怎么开始练1 问题定义不承担做错决策的代价不知道哪些问题重要每个需求写一页问题定义文档定期和客户坐一起2 价值判断不理解客户业务默认倾向是给更多每个决策附带商业代价练习最小可行方案3 系统架构局部推理强全局推理弱EvoClaw精确率腰斩读DDIA参与架构review练演进式升级4 安全审查继承训练数据漏洞45%含OWASP Top 10学OWASP Top 10用安全检查清单过AI代码5 上下文工程质量受限于上下文自己架构不了上下文写CLAUDE.md用MCP连接工具链沉淀Skills6 多Agent编排能执行任务管不了自己41%到86%失败率练任务分解建Agent分工矩阵在冲突中积累判断7 领域专业知识能读合规文档不能替你承担合规责任选一个垂直领域扎进去读法规标准积累踩坑故事8 沟通对齐不能跨团队谈判不能向高管解释tradeoff练技术到业务的语言翻译建stakeholder地图一句话总结这张表当你能审计、审查、大规模理解代码的能力超过写代码的能力你就安全了。五、按角色分层行动建议5.1 初级0到2年Stanford HAI的数据22到25岁开发者就业下降近20%。初级岗位的只会写代码定义在消失。但危险来自传统定义消失不是初级需求消失。Anthropic报告中的27%净新增工作表明AI在创造新类型工作。做什么不要和AI竞争机械任务。立刻掌握Cursor或Claude Code学MCP协议和Rules文件。停止刷LeetCode开始刷系统设计。找有mentorship的团队因为你需要的不是AI技能是在AI辅助下的判断力培养。这8个能力里先攻1问题定义和5上下文工程它们门槛最低、见效最快。5.2 中级3到5年最危险的一层。你已经在某个窄层建立了舒适区假设它永远保值。coddykit.com的警告精准最大风险是中级开发者固守了特定窄层技能假设该层永远有价值。做什么从写功能转向设计模块。深耕一个垂直领域成为AI无法替代的领域专家。这8个能力里先攻3系统架构、4安全审查、7领域专业知识。你的价值从实现质量迁移到设计质量。5.3 高级5年以上“Senior Tax正在成为真实问题。你的时间从做架构决策变成了一行一行审查Agent的输出”。做什么从审查者升级为评估系统设计者。构建自动化评估管线让机器审查机器。推动团队用Plan到Execute到Verify循环替代PR到Review到Merge。这8个能力里重点投6多Agent编排和8沟通对齐。你的价值在于能让整个团队的AI效率翻倍不在于你能写多少代码。六、开放讨论本系列前10篇拆解了AI来了程序员会怎样。从本篇开始转向哪些东西AI来了也动不了。EvoClaw那条38%的悬崖和Anthropic那个17%的理解退化指向同一件事AI的召回率在涨精确率在跌而保命能力全是精确率。8个能力里你觉得哪个对你当下的工作最有用哪个是你最薄弱的你用AI的时候是主动探究型还是被动委托型Anthropic的实验里这两类人的得分差了30个百分点。你落在哪一端欢迎在评论区分享你的真实状态。系列导航篇号标题Phase状态01AI写了90%的代码程序员正在消失冲击已发02裁了又招的回旋镖冲击已发03$2删库$5万赔偿冲击已发04一个GitHub Issue黑掉npm生态冲击已发05AI少乘一个汇率损失178万美元暗面已发06AI编程的70%墙暗面已发07提示注入正在武器化暗面已发0889%拿AI当裁员借口真实替代率4.5%暗面已发09会用AI的程序员正在吃掉不用AI的程序员突围已发10$20的Devin能取代你吗突围已发118个AI替代不了的能力程序员的保命清单突围本文12AI时代的铁饭碗突围待发数据来源Anthropic RCT (2026.01, arXiv:2601.20245)52名Python程序员学Trio库AI组技能测试得分低17个百分点调试能力分差最大主动探究65%以上 vs 被动委托35%。来源arXiv:2601.20245v1EvoClaw (2026.03, arXiv:2603.13428)南加州大学/UC Riverside/Stanford/Princeton/OpenHands联合发布。Claude Opus 4.6持续演进得分38.03%GPT 5.3 Codex 28.88%Gemini 3 Pro完整解决率13.37%。召回率线性上升精确率为瓶颈。饱和函数外推Opus 4.6渐近线约45%。来源arXiv:2603.13428, evo-claw.comAnthropic《When AI builds itself》(2026.06)Claude写80%以上代码工程师日均merge量为2024年8倍执行层接近人类判断层人类仍有优势Opus 4.5研究岔路口51%到Mythos Preview 64%。来源Anthropic InstituteSWE-EVO (2025.12, arXiv:2512.18470)GPT-5.4OpenHands在SWE-bench Verified 72.8% vs SWE-EVO 25%平均21文件874测试。来源第06篇已引用JetBrains (2026, Olga Bedrina)600多名开发者调查AI工具首要失败点为缺乏上下文和对复杂代码理解有限高于幻觉。来源bito.ai引用JetBrains研究CodeRabbit (2025.12)470个PR分析AI PR平均10.83问题 vs 人工6.45XSS 2.74倍逻辑错误1.75倍。来源第06篇已引用Veracode (2025-2026)100 LLM扫描45% AI代码含OWASP Top 10漏洞XSS通过率15%大模型不优于小模型。来源第05-06篇已引用Anthropic Agentic Coding Trends Report (2026.04)60%使用率0-20%委托率55%加速/40%减错27%净新增工作有高质量context文件团队快55%减错40%。来源第09篇已引用Gartner多Agent系统咨询量增长1445%57%企业部署多步骤Agent工作流。来源第09篇已引用PwC (2025)Global AI Jobs BarometerAI技能工资溢价56%。来源第09篇已引用Metamindz (2026)Agent相关岗位同比增长280%约9万岗位63%企业人才短缺。来源第09篇已引用Stanford HAI AI Index22-25岁开发者就业下降近20%。来源第08-09篇已引用precisionaiacademy (2026)67%资深工程师认为AI无法替代人类开发者AI-proof窗口12-18个月。来源precisionaiacademy.comMoonwell DeFi事故 (2026.02)少乘汇率178万美元损失。来源第05篇已引用Atlassian反转 (2026.03)CEO 2025.10承诺增招2026.03裁1600人(900研发)营收23%。来源第08篇已引用coddykit.com (2026)中级开发者固守窄层技能为最大风险。来源第09篇已引用标签AI编程 / 程序员生存 / AI不可替代能力 / 系统架构 / 上下文工程 / 安全审查 / 技能升级 / Agent编排
返回列表