
我大概是2024年年初开始系统重读多模态论文的当时大家还在争论LLaVA和MiniGPT-4谁的路子更对不到两年时间这个领域的焦点已经从“怎么把图像和文本拼在一起”变成了“怎么让模型在物理世界里做推理和规划”。这篇梳理就是想把我这两年读过的、追过的论文按主线串一遍从Fusion阶段的架构和数据工程到Token化统一带来的范式转移再到Reasoning Agent和World Model真正浮出水面的2026年。如果你是在校研究生这篇文章能帮你建立一条清晰的选题地图不需要从海量论文里乱撞如果是做工程落地的后半部分关于Agent和世界模型的讨论可能比你手头正在调的多模态检索系统更接近下一波产品形态。我尽量把每条技术线的来龙去脉讲清楚也会穿插一些实际复现和跑实验时踩过的坑。1. 先看大势2024—2026 多模态的三年转向1.1 为什么从 Fusion 讲起2024年的多模态研究从我的观察看几乎全被Fusion这条主线统治着。所谓Fusion本质上是把视觉、语言、音频等不同模态的编码结果在某个层级拼到一起然后丢给一个统一的主干网络去处理。CLIP在2021年把对比学习做到了图像和文本的对齐2024年的工作基本是把这种对齐从“特征空间”推进到了“生成空间”模型不仅要能算出图像和文本像不像还得能根据图像说出一段完整的话根据一段文字画出合理的图。这个阶段的核心矛盾非常直白视觉编码器、文本编码器、生成模块来自不同的预训练体系它们之间的接口怎么设计放到2024年初主流方案是“浅融合”也就是把图像切块后通过一个Projection层映射到大语言模型的输入空间冻结或者微调大模型的参数让大模型“读图”。LLaVA系列是这条路的教科书LLaVA-OneVision在2024年中期把这种模式做到了一个高峰一份数据、多个模型尺寸、跨图像和视频的通用能力在开源社区里非常能打。但这类方案有个绕不开的天花板——视觉编码器的分辨率限制和语言模型的序列长度限制。你把一张高分辨率截图切成了几百个Patch每个Patch都变成语言模型的Token上下文直接爆掉。所以2024年下半年大量论文开始往“深层融合”走比如把视觉Token和文本Token同时输入一个Transformer在每一层都做交互而不是只在入口处用Projection粘一下。InternVL系列就是这条路线的代表它把ViT的参数也算进大模型的整体训练里视觉和文本的交互更早、更充分。我的建议是如果去读2024年的论文不要只看模型结构还要看训练策略。同一个架构用两阶段训还是四阶段训效果差距能拉得很大。这也是为什么后面我会专门用一节来讨论数据工程和训练配比。1.2 2024—2025 的暗线Token 化与数据工程如果说Fusion是明面上的主线那Token化就是一条容易被忽视的暗线。2024年底开始越来越多人意识到既然大语言模型的核心能力来自“序列预测”那为什么多模态非要保留独立的视觉编码器加独立的Bridge能不能把图像也变成离散Token和文本一起放进同一个自回归模型里这条路线的代表作是NExT-GPT它用轻量对齐层把各模态编码器和LLM粘起来理论上支持Any-to-Any的生成更激进的工作是Emu3和Chameleon直接尝试让图像、文本甚至视频都走统一的离散Token空间。Emu3在2024年公开的时候很多人觉得它就是用来刷新SOTA的但它的意义远不止数字它证明了Transformer处理多模态输入时可以不加任何模态专属结构。一直追到2025年Token化已经不是某个实验室的孤例了。从Meta的Chameleon到阿里、字节开源的一系列统一模型大家都在围绕“离散视觉Token的质量”和“多模态序列的统一长度管理”这两个核心问题做文章。图像Token的质量直接决定了重建的清晰度而长度管理则决定了训练成本因为一张256x256的图往往要拆成几百个Token比一段短文本还长。还有一件事在2025年被推到了台前数据工程。多模态模型的底子很大程度上不是网络结构决定的而是训练数据的配比和时间混排顺序决定的。业界有个共识文本数据质量高但多模态数据量少简单粗暴地混合会导致模型在图像理解上严重退化。NExT-GPT论文里其实就用了多阶段的训练数据配比来缓解这个问题——先做多模态对齐再做指令微调最后才做RLHF——但真正要复现配比细节每一种都要自己试。2. Fusion 时代架构、训练与数据三条主线2.1 架构流派从浅融合走向预训练级融合如果你从2024年初的论文开始读会明显感受到Fusion架构的三次迭代。第一代是LLaVA式的浅融合。视觉编码器固定图像经过一个线性投影层直接变成LLM的输入Prefix。优点是训练快成本低一张A100就能把7B模型训起来缺点是视觉信号只注入一次模型的底层和中层完全感受不到视觉信息。第二代是VILA和LLaVA-NeXT代表的“高分辨率 自适应Token压缩”。这类工作开始关注图像分辨率对OCR和细粒度理解的影响把图像切成多个Crop每个Crop独立编码再合并试图在不增加太多计算的前提下保留细节。LLaVA-NeXT还把AnyRes机制放到了开源社区后面很多框架都借鉴了这个思路。第三代就是预训练级融合了代表是InternVL系列、Qwen2-VL和MiniCPM-V这些。此时视觉编码器和LLM已经不再各自独立而是作为同一个Transformer的前后端进行联合预训练。区别在于联动的深度Qwen2-VL用原生动态分辨率直接按输入图像的长宽比生成视觉Token序列InternVL则通过Pixel Shuffle把视觉Token的空间信息压进通道降低序列长度。这两条技术路线到现在也还在并行演化。我复现过Qwen2-VL的推理代码最直观的感受是训练时对视觉Token的位置编码做了精细处理不同分辨率的图像位置编码长度不一样这是浅Fusion时代完全不需要考虑的。所以当你读这类论文时重点看它怎么解决“变长视觉序列”和“位置编码外推”这两个交通问题这比看它刷了多少Benchmark更有价值。2.2 训练策略从两阶段对齐到端到端统一训练策略在Fusion时代的重要性怎么说都不为过。早期LLaVA用两段式训练先冻结视觉塔和LLM只训Projection做图像-文本对齐再冻结视觉塔解冻LLM做指令微调。这个流程在7B模型上非常有效因为你用很少的数据就能让模型学会“看图说话”。但两阶段训练的天花板在于视觉塔总是被冻结它的特征表达能力就停在CLIP预训练时的水平。所以后面VILA和LLaVA-OneVision开始把视觉塔放开采用“预训练-指令微调”两段式但视觉塔低学习率的设计让视觉特征能跟着任务走。MiniCPM-V则把训练压缩到更少阶段通过强数据筛选和模型裁剪把多模态能力塞进2B甚至1B模型里这对端侧部署的启发特别大。这里有个实操经验可以分享直接按论文里的超参数去复现很容易在单卡或小集群上跑出一堆NaN尤其是视觉塔解冻后学习率稍高一点就会崩。我自己踩过的坑是视觉塔学习率保持LLM的1/10到1/100最稳另外混合训练时要给图像文本对加一个最低占比不然模型到后期会逐渐退化成一个纯语言模型。再说端到端统一。NExT-GPT和Emu3都尝试了“所有模态Token输入、所有模态Token输出”的设定理论上这是最符合“多模态智能体”需求的架构用户给一张图和一句话模型能生成一段语音和一个规划动作。但这类模型的训练成本极高因为它要求图像生成、语音合成和语言生成共享同一个模型输出维度不同损失函数很难平衡。Emu3依靠自回归离散Token避开了这个问题但视觉Token重建的细节丢失依然存在。做部署的人相对会比较关注类似MLLM–RLHF这类轻量调优方案而不是从头训练一个端到端模型。2.3 数据工程质量与配比的隐性胜负手说句可能被大家忽略的话2024—2025年多模态模型的进步一半是架构的进步一半是数据工程做的进步。你会发现很多论文的消融实验里结构变动的收益只有1到2个点换了更好的数据筛选和配比却能拉高3到4个点。数据工程里核心都是“粒度对齐”。文本里的描述可能只说“一个人站在街上”但图像里这个人穿什么衣服、街边有什么招牌模型默认是不学的。所以LLaVA-1.5和ShareGPT4V这些数据集的作者花了大量精力做短样本plausible negative和长样本描述逼模型去学细节。做业务落地的时候如果你手上的数据是粗糙的图文对不要急着训练先用Caption模型把数据清洗一遍往往比你换一个更大的模型还管用。训练配比也有讲究。2024年中旬之后开源社区普遍采用“纯文本 图文对 指令微调 推理增强”的联合训练可以提升模型的综合性——这个问题被称为“多模态灾难性遗忘”。我见过一个团队不控制图文比例只堆图像数据结果模型一个月后连基本的问答都开始胡说八道。后来把文本数据比例恢复到25%左右模型才回正常而且亮点是多模态指标也没掉多少。这个配比经验对不同规模模型有差异但核心原则相同文本是底子图像是增量。数据工程还有一个坑Crop策略。同一张图中心裁剪和随机裁剪对模型学到的东西影响很大。你的模型如果经常处理长图、截图不在数据里有针对性地做整图输入到线上就会出现“图片一长就乱答”的毛病。现在很多论文单独讨论多视图、拼图、稀疏采样其实都是在解决这个数据分布问题。3. 从多模态到 Reasoning Agent推理能力的跃迁3.1 为什么纯对齐做不出推理2024年的Fusion模型能回答“图上有什么”但很难回答“图上这个人下一步会做什么”。原因在于融合模型学到的更多是统计相关而不是因果链或状态转移。你让它识别一张包含杯子和桌子的图它能说对你问它“杯子摔下来会怎样”它往往给不出合理解释——因为它没有学过程度推理的中间过程和物理常识。当时OpenAI的o1模型发布让整个多模态社区意识到“推理”可能是下一个重要Hi级任务。o1带来的核心思路是推理长链CoT不只是提示词技巧而是可以用强化学习训练出来的。于是2025年开始多模态领域出现了一大批把RL引入视觉推理的论文比如LMM-R1它把DeepSeek的GRPO算法移植到多模态模型上让模型通过试错和奖赏信号学会“先看了图片再说”。我自己跑了LMM-R1的开源版本发现一个有意思的现象推理能力的出现往往伴随着模型会先输出一段OCR或者定位信息再去推理。这对Fusion时代的对齐训练来说毫无必要但对推理模型来说却可能是关键——因为定位和OCR是低层次的“证据”是模型用来支撑后续推理的基石。3.2 多模态推理的层级划分读2025年的多模态推理论文建议先建立层级意识。我把它们分成了四层感知层、基础推理层、复杂规划层和反思层。感知层解决“能不能看清楚”对应高分辨率、OCR、视觉定位这些能力基础推理层解决“一句话能不能判断”比如空间关系、属性比较、常识问答复杂规划层解决“多步怎么办”比如让模型根据桌面上的食材规划一个烹饪流程反思层则是“发现我错了再修正”目前在多模态模型上还非常不成熟。现在的Benchmark也是一层一层垒上去的。MathVista测基础推理MMMU测学科知识理解SEED-Bench和BLINK测感知和时序而像DART这样的数据集已经开始测“多模态规划”了。我之前用DART测了几个主流开源模型结果发现大多数模型在第一步“理解图形中的规则”就挂掉根本走不到规划。这说明推理不是某一个模块能解决的而是感知、语言、规划全链路的问题。从论文阅读的角度我建议重点关注复杂规划层的工作。比如使用MCTS蒙特卡洛树搜索在多模态空间里搜索推理路径或者用A*式的算法去展开视觉计划树。这些方法虽然现在还很慢但它在某种意义上把“推理”变成了“可搜索的问题”这比直接指望模型抖机灵要可靠得多。3.3 让 Agent 真正“基座化”的做法2025年下半年起业界越来越多地讨论一个词Agentic Base Model。意思是模型本身不应该只是“回答问题的底座”而应该是一个能自主拆解任务、调用工具、观察反馈并规划下一步的Agent基座。多模态在这个方向上的价值特别明显因为Agent不光要看文本还要看屏幕截图、摄像头画面、GUI界面甚至要在网页上点按钮做操作。这个方向上有几类重要工作。一类是UI Agent比如OS-Atlas和UI-TARS把操作系统的截图作为视觉输入让模型输出“点击哪个坐标、输入什么文本”。另一类是“视触觉融合Agent”把机械臂的触觉信号和摄像头画面结合起来做精细操作这在机器人领域比较热。还有一类是“多模态记忆Agent”模型会将历史交互中的视觉信息做压缩和索引在长会话里能调出之前见过的图片真正做到“我记得你上次给的菜谱”。我在一个内部项目里试过类似方案把浏览器截图直接发给一个支持视觉输入的LLM配一个Python脚本让它提炼页面信息并出操作。效果比预期好但有限的教训是Agent上下文窗口还是不够长——截图动辄几千Token要把页面缩小只能降清晰度一降清晰度又失去了OCR能力。所以现在很多论文在做“紧凑视觉表征”把关键区域的像素特征压缩成一个“场景摘要”。这个方向非常值得关注因为它直接决定了Agent的任务上限。讲到Reasoning Agent还必须提一句RL。传统SFT能训练模型按格式输出但模型不会自己纠错。真正让Agent学会“这条路走不通就换一条”的是强化学习提供的探索和奖惩信号。当前主流做法是先拿大量SFT数据让模型学会基本动作再用RL去优化决策策略最后用环境模拟器或真实点击反馈做在线对齐。这个链路已经是Agent基座模型训练的标准配置了。4. 世界模型多模态的下一个主战场4.1 世界模型不是“预测下一帧”世界模型这个词这两年被用烂了很多做视频生成的人把“预测下一帧”叫做世界模型这个混淆挺大的。严格的World Model核心是学到环境的“状态转移函数”给你一个状态和一个动作你预测出下一个状态。视频帧只是状态的一种表现形式物理规则、因果推理、物体交互和空间一致性才是世界模型真正要学的。2024年的Genie 2把token化世界模型做到了交互式用户可以用键盘控制Agent在生成的3D场景里走模型实时生成第一人称视角的画面。它不是在做纯视频预测而是在维护一个虚拟世界状态——你向左走墙壁会移动门会打开物体具备“可见但不可穿”的性质。这才是世界模型的意义。UniSim也很有代表性它把自动驾驶、机器人操作和游戏场景统一到一个仿真平台里让模型在这些环境里做“想象”然后通过对比真实的观测结果来更新世界模型就跟人类在脑子里先预演一遍再动手一样。4.2 当前几条务实路线从我实际跟进的论文看世界模型目前有几条路线比较务实。第一条是“离散Token世界模型”把视频帧离散化成Token序列用自回归Transformer预测下一帧Token。Genie 2和部分MOFA工作是这个思路。优势是能直接复用LLM的完整基建劣势是Token重建细节丢。第二条是“Dynamic 3D 物理引擎蒸馏”模型不是从像素里学物理而是先用一个可微的物理引擎生成轨迹再蒸馏到神经网络里。这套方案比较适合机器人操控因为它的泛化性和样本效率都比直接从视觉学要高。第三条是“将世界模型嵌入LLM作为想象模块”LLM决定“动作计划”世界模型负责“展开结果”再让LLM根据展开的结果修正计划形成一个闭环比对Imagine-Assess-Correct。这相当于给语言模型加了一个内部模拟器。这三条路线不是互斥的。2026年前后的论文里出现了很多“视频生成模型世界模型”的混合体。比如HoloWorld就是把视频生成和多模态世界模型统一在一个框架内让你既可以用文字生成视频片段也可以反过来用一段视频推导出状态的转移。我在复现过程中体会最深的是世界模型的评测非常麻烦你不能只看生成画面的美观度要看“状态一致性”。给你一叠多米诺骨牌的视频你推倒第一张后面的牌是不是按物理规律依次倒下这个评测标准和视频生成评估完全不同需要自己设计可控场景。目前社区里已经有WMBWorld Model Benchmark之类的评测集但覆盖范围仍很有限。4.3 和 LLM 结合的工程路径世界模型真正想做产品最后还是要跟LLM结合。目前比较主流的工程化路径是“Action - World Model - Plan”的三段式模型先用视觉感知模块把当前的观测转成结构化状态比如场景图/物体列表然后交给世界模型做状态推演最后再让语言模型根据推演结果生成自然语言指令或计划文本。整个过程里多模态的职责就从“理解”变成了“想象”。我实操过一套简化版直接用World Model的隐状态接LLM的跨注意力层让语言模型在生成答案时可以“想象”多种情况再选。这个方向做起来很费显存因为世界模型和LLM都在生成显存量相当于跑两个大模型所以我们当时压缩了世界模型的分辨率只在LLM做高层次的语义选择时接入。效果依然能感受到尤其是在常识问答这类需要物理直觉的任务上模型会比纯LLM少犯很多低级错误。这个方向可能在多模态评价体系里会延伸出更多“预测与规划”类任务。如果你做的是机器人、自动驾驶、具身智能世界模型的价值会更高——因为它让模型在面对新环境时不再是“答不对就瞎猜”而是能够先在脑子里“试一遍”。5. 论文阅读方法与实践心得5.1 三年时间线阅读法既然都是做这个方向的研究者我可以和你聊聊我这两年的读论文方法论。纯按时间顺序读是本末倒置我推荐“三年时间线阅读法”。第一步先读2024年的Fusion代表作搞清楚多模态的基本问题定义。LLaVA、InternVL、Qwen2-VL、MiniCPM-V各挑一篇精读只读代码不读论文也行但一定要把“输入图像怎么变成Token”“这些Token怎么和文本融合”这两条链路彻底弄明白。这一步是在打地基。第二步跳到2025年读Token化和统一模型NExT-GPT、Emu3、Chameleon这几篇必看。重点看它们怎么处理“图像生成和文本生成的损失平衡”以及“离散Token重建质量问题”。看完你会发现很多Fusion时代的争论在这个框架下根本不存在因为全部统一成一个自回归问题了。第三步读2026年前沿那批Reasoning Agent和World Model的论文。注意力放在RL训练细节、世界模型评测设定和Agent可交互场景上。因为这部分论文的很多结论还挑战着所在领域的共识你读的时候保持批判它到底是真的有效还是只是数据集刷得好5.2 复现与评估中的坑复现多模态论文我有一些“过来人”的经验可以分享。第一个坑是数据配比复现不出来。很多论文不在正文里写清楚到底给了模型多少文本数据、多少图像数据只在附录里给个表格甚至只给个总样本数。你按他们代码仓库的默认配置跑效果往往对不上。遇到这种情况我一般会去翻他们的DataMix重点看文本token和图像token的比例然后自己做个消融调整到自己数据集的效果最好为止。第二个坑是评估指标选择。多模态模型的评测特别是开放式问答的评测自动指标和人工指标经常打架。CLIPScore和G-Eval评分高不代表模型答得对因为评测模型本身也会被输入文本的长度和风格带偏。建议每跑一个实验都抽20到50个case自己看一遍。这个工作量和训练也差不多但训练冒了这么多GPU成本不人工抽检一下真的亏。第三个坑是Token压缩。视觉Token动不动上千模型上下文一下就满。很多论文里的Tail-Free或Token Merging看起来很美好实际一测在小目标检测和OCR场景下半数都会失效。做业务的时候宁可先做两阶段先让模型定位再让模型用高分辨率的局部区域做识别都比直接压缩视觉Token稳。5.3 一些选题建议对于准备在这个方向上发力的人我琢磨了一下觉得还有几类工作值得跟进一是“视觉Token压缩细粒度重建”的组合。这个方向目前看起来研究得还不足但产品需求非常真实——电子文档、截图理解、医学影像全都要高保真的小Token。二是“多模态Agent的长会话记忆”。很多Agent模型在单轮截图理解上已经做得不错但一到长会话就抓瞎因为你没法把半个小时的视频都塞进上下文里。怎么在会话中动态维护视觉记忆是很值得做的方向。三是“世界模型下的安全性与幻觉评估”。世界模型生成的内容越真实潜在风险也越大。未来社区需要一套标准来评估模型是否将用户引导到不安全的物理操作上——这个方向既冷门又十分重要。四是在“Fusion的遗留问题”上做修补比如多语言多模态对齐、音视频联合理解、端侧轻量化推理。这些方向虽然不那么性感和显眼但在工业界的需求量一直向上走反而比那些一线研究者扎堆的地方更容易出成果。我个人的体会是2024到2026这三年是多模态从“会看”走向“会想”的三年。Fusion阶段把各种模态接到了语言模型身上Token化阶段让它们共享了同一套序列范式而Reasoning Agent和World Model则让模型不再满足于“回答”开始学会“行动”和“预测”。这个变化对做研究的人来说是机会对做产品的人来说更是机会——因为旧的问题在换框架新的问题也在不停冒出来谁先啃下其中一块硬骨头谁就能在下一轮竞争里占住身位。