ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

扩散语言模型终破100B规模!蚂蚁LLaDA2.2正面叫板自回归,杀入Agent战场

扩散语言模型终破100B规模!蚂蚁LLaDA2.2正面叫板自回归,杀入Agent战场 ChatGPT出来快三年了大模型圈几乎形成了一种共识自回归AR似乎就是通往通用智能的主路线。GPT-3、GPT-4、Llama、Qwen主流大模型全在沿着同一条路径狂奔更大的参数、更多的数据、更长的上下文。路越走越宽也越走越挤。一个token接一个token往外蹦的生成方式模型越来越大、需求越来越复杂推理效率慢慢成了绕不过去的坎。那能不能换种生成方式扩散语言模型dLLM给了个不一样的答案。理论上扩散语言模型可以并行预测多个token不用像AR模型那样死等前一个token生成完。同时它还天然具备双向上下文建模的能力。但过去几年扩散语言模型始终没进大模型的主战场。公开的最大离散扩散语言模型规模长期卡在8B而AR那边早就冲到几百B了。关键问题一直没人答得上来扩散语言模型的这些理论优势在百B级规模还能站得住吗规模持续放大后它到底能不能跟成熟的AR路线正面掰手腕蚂蚁联合多所高校发了LLaDA系列技术报告沿着一条清晰的路线连推三个版本。LLaDA2.0先把模型做到了100B47个benchmark上综合追平同规模AR编程和智能体任务已经领先。2.1在此基础上加了 T2T 编辑通道和EBPO强化学习推理速度冲到1587 TPS36个基准全面超过2.0。但这两版有一个共同的限制编辑只能一对一替换token不能增删。到了Agent场景面对缺失参数、重复n-gram、残缺代码块替换根本兜不住。于是有了LLaDA2.2。这次的重点不再是堆规模或提速度而是直接把扩散语言模型推进 Agent 的核心战场让扩散模型在工具交互任务中首次展现出超过同规模自回归模型的潜力。技术报告链接https://github.com/inclusionAI/LLaDA2.X01WSD三阶段持续预训练把dLLM推到100B一LLaDA2.0把扩散模型送上牌桌之前扩散语言模型最大只有8BAR那边几十B、几百B遍地跑。LLaDA2.0干了件别人没干成的事把扩散语言模型做到了100B。关键不是从零训而是拿现成的AR模型通过WSD三阶段持续预训练慢慢洗成扩散模型。Warmup逐步放大块大小让模型适应扩散目标Stable在全序列上充分训练Decay再缩回来保留推理效率。再加上CAP训练让模型解码时更果断推理速度反超AR最多2.1倍。47个benchmark 上100B的flash版综合73.18分差不多追平同规模AR。编程和智能体已经领先了。扩散语言模型上了桌。但两个问题还悬着速度还能更快吗并行解码的局部不一致在复杂任务上会不会崩这俩问题成了LLaDA2.1往下推的方向。光堆规模不够下一步是让扩散模型具备那种回头看、改一改、纠个错的能力。二LLaDA2.1学会改错速度翻倍LLaDA2.1加了一条T2T编辑通道模型能回头看了能纠错了。配合SMode和QModeflash版编程峰值干到892 TPSmini版冲到1587 TPS。同规模AR一般也就200到350。还引入了EBPO强化学习用ELBO替代精确对数似然来估计策略梯度把dLLM 的RL训练拉到了规模化的水平。36个基准上QMode全面超过2.0。但2.1的T2T只能一对一替换不能增删token。碰上缺失参数、重复n-gram、残缺代码块替换根本解决不了。在Agent场景里这就不够灵活了。普通文本生成的话这个限制影响不大。可一旦进了Agent任务模型面对的是不断变化的环境反馈得持续修改自己的行动轨迹。光靠替换token已经兜不住了。02扩散语言模型正式进入Agent时代Agent场景里模型不是单轮生成一段文字就完事了。它得读长的交互历史、规划多步动作、调用外部工具、根据环境反馈修正自己的行为。早期的一点点小错可能像滚雪球一样把后面所有步骤全污染了。LLaDA2.1的T2T编辑在这种场景下暴露了两个致命短板。第一固定长度替换解决不了结构性问题。JSON里多了一个括号或者少了一个参数字段替换没辙。第二块并行解码的任意顺序去噪容易导致推理路径坍缩。低不确定性的 token 先被定死高不确定性的分叉点反而被推迟处理上下文过早锁定了关键决策。LLaDA2.2的答案很干脆把编辑机制从一对一的替换升级成Levenshtein四操作编辑KEEP保留、SUBSTITUTE替换、DELETE删除、INSERT插入。不过要让扩散语言模型真正服务Agent光有编辑能力还不够。长上下文记忆、推理效率、专家路由的算力成本这些问题一个都绕不过去。一128K 长上下文Agent任务的交互历史动不动就几十K token。LLaDA2.2从2.1的8K底座出发两阶段渐进式长上下文持续预训练先在300B token的64K语料上训再用200B token扩展到128K最终原生支持128K上下文窗口。另一个是MoE的推理开销。标准MoE每个token独立选专家块扩散解码时一块32到64个token各自选top-k活跃专家集合可能膨胀到好几十个HBM流量和通信开销直接爆炸。LLaDA2.2搞了个Block Routing先在块级别做专家准入选出固定容量C48 的专家池再在池内 token级路由。每个推理块的专家工作集有了可预测的上界token级的专业化也保住了。二 Levenshtein编辑这是2.2最核心的创新。扩散解码过程中模型不仅可以从[MASK]生成tokenM2T不仅可以把已有token换成另一个T2T还可以删掉多余的token或者在指定位置插入新的[MASK]槽位。训练标签通过LCS最长公共子序列对齐自动构造。模型生成的中间草稿和ground-truth对齐后匹配位置标KEEP错位标SUBSTITUTE多余标DELETE缺失标INSERT。训练目标同时覆盖了预测正确token和判断增删操作这两类决策。效果很直接。同一底座在相同SWE轨迹数据上做SFT只开关Levenshtein编辑这一项差异SWE-bench Verified从35.8分跳到44.4分8.6个点。删和插这两个操作解决的是Token Editing改不动的硬骨头。三L-EBPOAgent场景下的编辑不是一个孤立的纠错动作而是一系列跟环境交互的策略性决策。LLaDA2.2搞了个L-EBPO把Levenshtein编辑操作纳入了强化学习的动作空间。具体来说动作空间从原来的猜下一个token扩展到了 {token词汇表} ∪ {DELETE, INSERT}。L-EBPO在外层用EBPO优化轨迹级决策在内层管理块内编辑什么时候删、什么时候插、在哪插。奖励信号完全来自环境反馈工具调用是否正确、输出格式是否合法、任务有没有完成。训练基础设施用ASystem做分布式编排SGLang做rollout生成AKernel管理大规模沙箱集群。rollout收集、沙箱服务、环境执行和策略优化全部异步并行。03交互式工具使用全面反超AR参照7个Agent基准上LLaDA2.2-flash平均53.83分AR参照Ling-2.6-flash是55.74差距不到2分。在交互式工具使用任务上LLaDA2.2-flash全面反超了AR模型τ²-Bench高出近4个点PinchBench略占上风MCP-Atlas领先超过5个点。扩散模型在需要动态感知和反馈闭环的场景里反而有优势。主要弱项在仓库级软件工程。SWE-bench Verified 拿了49.28比AR的61.20低了十几个点多语言版本也只有25.00落后AR近9个点。长程代码修复这块AR还是更稳。通识能力方面10个基准上2.2-flash平均56.81分低于2.1的59.23和Ling-2.6的65.90。亮点是LongBench v22.2拿了45.13略高于AR的42.94128K长上下文的效果算验证了。11个典型工作负载上LLaDA2.2-flash的BF16推理吞吐平均是Ling-2.6-flash的 1.64倍。FP8量化再提18.6%。Agent 任务里的BFCL-v4冲到703.82 TPSSWE-bench Verified 也到519 TPS。同时放出Agent分数和TPS数据LLaDA2.2想说的东西很清楚扩散模型不是速度换质量是可以同时拿到速度和竞争力。至少在多轮交互式Agent场景里这已经是事实。04自回归之外Agent时代的另一条路线LLaDA2.2并没有证明扩散语言模型已经全面超越自回归。它证明的是一件更重要的事在大模型发展的下一阶段自回归之外确实存在一条可扩展的新路线。交互式Agent任务全面超过同规模AR推理吞吐碾压1.64 倍128K长上下文也站住了。短板当然还在指令遵循、知识推理、长程代码修复这些AR还是更稳。通识能力差距依旧明显Agent的优势还覆盖不了所有任务。但方向已经很清楚了。并行解码、双向上下文、灵活编辑这些架构层面的先天优势不是靠工程技巧能追平的。自回归卷了三年做到了千亿、万亿扩散这条路才刚开始放大。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表