我大概是2024年年初开始系统重读多模态论文的,当时大家还在争论LLaVA和MiniGPT-4谁的路子更对,不到两年时间,这个领域的焦点已经从“怎么把图像和文本拼在一起”变成了“怎么让模型在物理世界里做推理和规划”。这篇梳理就是想把我这两年读过的、追过的论文按主线串一遍,从Fusion阶段的架构和数据工程,到Token化统一带来的范式转移,再到Reasoning Agent和World Model真正浮出水面的2026年。
如果你是在校研究生,这篇文章能帮你建立一条清晰的选题地图,不需要从海量论文里乱撞;如果是做工程落地的,后半部分关于Agent和世界模型的讨论,可能比你手头正在调的多模态检索系统更接近下一波产品形态。我尽量把每条技术线的来龙去脉讲清楚,也会穿插一些实际复现和跑实验时踩过的坑。
1. 先看大势:2024—2026 多模态的三年转向
1.1 为什么从 Fusion 讲起
2024年的多模态研究,从我的观察看,几乎全被Fusion这条主线统治着。所谓Fusion,本质上是把视觉、语言、音频等不同模态的编码结果在某个层级拼到一起,然后丢给一个统一的主干网络去处理。CLIP在2021年把对比学习做到了图像和文本的对齐,2024年的工作基本是把这种对齐从“特征空间”推进到了“生成空间”:模型不仅要能算出图像和文本像不像,还得能根据图像说出一段完整的话,根据一段文字画出合理的图。
这个阶段的核心矛盾非常直白:视觉编码器、文本编码器、生成模块来自不同的预训练体系,它们之间的接口怎么设计?放到2024年初,主流方案是“浅融合”,也就是把图像切块后通过一个Projection层映射到大语言模型的输入空间,冻结或者微调大模型的参数,让大模型“读图”。LLaVA系列是这条路的教科书,LLaVA-OneVision在2024年中期把这种模式做到了一个高峰:一份数据、多个模型尺寸、跨图像和视频的通用能力,在开源社区里非常能打。
但这类方案有个绕不开的天花板——视觉编码器的分辨率限制和语言模型的序列长度限制。你把一张高分辨率截图切成了几百个Patch,每个Patch都变成语言模型的Token,上下文直接爆掉。所以2024年下半年,大量论文开始往“深层融合”走,比如把视觉Token和文本Token同时输入一个Transformer,在每一层都做交互,而不是只在入口处用Projection粘一下。InternVL系列就是这条路线的代表,它把ViT的参数也算进大模型的整体训练里,视觉和文本的交互更早、更充分。
我的建议是,如果去读2024年的论文,不要只看模型结构,还要看训练策略。同一个架构,用两阶段训还是四阶段训,效果差距能拉得很大。这也是为什么后面我会专门用一节来讨论数据工程和训练配比。
1.2 2024—2025 的暗线:Token 化与数据工程
如果说Fusion是明面上的主线,那Token化就是一条容易被忽视的暗线。2024年底开始,越来越多人意识到:既然大语言模型的核心能力来自“序列预测”,那为什么多模态非要保留独立的视觉编码器加独立的Bridge?能不能把图像也变成离散Token,和文本一起放进同一个自回归模型里?
这条路线的代表作是NExT-GPT,它用轻量对齐层把各模态编码器和LLM粘起来,理论上支持Any-to-Any的生成;更激进的工作是Emu3和Chameleon,直接尝试让图像、文本甚至视频都走统一的离散Token空间。Emu3在2024年公开的时候,很多人觉得它就是用来刷新SOTA的,但它的意义远不止数字:它证明了Transformer处理多模态输入时可以不加任何模态专属结构。
一直追到2025年,Token化已经不是某个实验室的孤例了。从Meta的Chameleon到阿里、字节开源的一系列统一模型,大家都在围绕“离散视觉Token的质量”和“多模态序列的统一长度管理”这两个核心问题做文章。图像Token的质量直接决定了重建的清晰度,而长度管理则决定了训练成本,因为一张256x256的图往往要拆成几百个Token,比一段短文本还长。
还有一件事在2025年被推到了台前:数据工程。多模态模型的底子,很大程度上不是网络结构决定的,而是训练数据的配比和时间混排顺序决定的。业界有个共识,文本数据质量高但多模态数据量少,简单粗暴地混合会导致模型在图像理解上严重退化。NExT-GPT论文里其实就用了多阶段的训练数据配比来缓解这个问题——先做多模态对齐,再做指令微调,最后才做RLHF——但真正要复现,配比细节每一种都要自己试。
2. Fusion 时代:架构、训练与数据三条主线
2.1 架构流派:从浅融合走向预训练级融合
如果你从2024年初的论文开始读,会明显感受到Fusion架构的三次迭代。第一代是LLaVA式的浅融合。视觉编码器固定,图像经过一个线性投影层直接变成LLM的输入Prefix。优点是训练快,成本低,一张A100就能把7B模型训起来;缺点是视觉信号只注入一次,模型的底层和中层完全感受不到视觉信息。
第二代是VILA和LLaVA-NeXT代表的“高分辨率 + 自适应Token压缩”。这类工作开始关注图像分辨率对OCR和细粒度理解的影响,把图像切成多个Crop,每个Crop独立编码再合并,试图在不增加太多计算的前提下保留细节。LLaVA-NeXT还把AnyRes机制放到了开源社区,后面很多框架都借鉴了这个思路。
第三代就是预训练级融合了,代表是InternVL系列、Qwen2-VL和MiniCPM-V这些。此时视觉编码器和LLM已经不再各自独立,而是作为同一个Transformer的前后端进行联合预训练。区别在于联动的深度:Qwen2-VL用原生动态分辨率,直接按输入图像的长宽比生成视觉Token序列;InternVL则通过Pixel Shuffle把视觉Token的空间信息压进通道,降低序列长度。这两条技术路线到现在也还在并行演化。
我复现过Qwen2-VL的推理代码,最直观的感受是训练时对视觉Token的位置编码做了精细处理,不同分辨率的图像位置编码长度不一样,这是浅Fusion时代完全不需要考虑的。所以当你读这类论文时,重点看它怎么解决“变长视觉序列”和“位置编码外推”这两个交通问题,这比看它刷了多少Benchmark更有价值。
2.2 训练策略:从两阶段对齐到端到端统一
训练策略在Fusion时代的重要性,怎么说都不为过。早期LLaVA用两段式训练:先冻结视觉塔和LLM,只训Projection,做图像-文本对齐;再冻结视觉塔,解冻LLM做指令微调。这个流程在7B模型上非常有效,因为你用很少的数据就能让模型学会“看图说话”。
但两阶段训练的天花板在于,视觉塔总是被冻结,它的特征表达能力就停在CLIP预训练时的水平。所以后面VILA和LLaVA-OneVision开始把视觉塔放开,采用“预训练-指令微调”两段式但视觉塔低学习率的设计,让视觉特征能跟着任务走。MiniCPM-V则把训练压缩到更少阶段,通过强数据筛选和模型裁剪,把多模态能力塞进2B甚至1B模型里,这对端侧部署的启发特别大。
这里有个实操经验可以分享:直接按论文里的超参数去复现,很容易在单卡或小集群上跑出一堆NaN,尤其是视觉塔解冻后学习率稍高一点就会崩。我自己踩过的坑是,视觉塔学习率保持LLM的1/10到1/100最稳,另外混合训练时要给图像文本对加一个最低占比,不然模型到后期会逐渐退化成一个纯语言模型。
再说端到端统一。NExT-GPT和Emu3都尝试了“所有模态Token输入、所有模态Token输出”的设定,理论上这是最符合“多模态智能体”需求的架构:用户给一张图和一句话,模型能生成一段语音和一个规划动作。但这类模型的训练成本极高,因为它要求图像生成、语音合成和语言生成共享同一个模型,输出维度不同,损失函数很难平衡。Emu3依靠自回归离散Token避开了这个问题,但视觉Token重建的细节丢失依然存在。做部署的人相对会比较关注类似MLLM–RLHF这类轻量调优方案,而不是从头训练一个端到端模型。
2.3 数据工程:质量与配比的隐性胜负手
说句可能被大家忽略的话:2024—2025年多模态模型的进步,一半是架构的进步,一半是数据工程做的进步。你会发现很多论文的消融实验里,结构变动的收益只有1到2个点,换了更好的数据筛选和配比却能拉高3到4个点。
数据工程里核心都是“粒度对齐”。文本里的描述可能只说“一个人站在街上”,但图像里这个人穿什么衣服、街边有什么招牌,模型默认是不学的。所以LLaVA-1.5和ShareGPT4V这些数据集的作者花了大量精力做短样本(plausible negative)和长样本描述,逼模型去学细节。做业务落地的时候,如果你手上的数据是粗糙的图文对,不要急着训练,先用Caption模型把数据清洗一遍,往往比你换一个更大的模型还管用。
训练配比也有讲究。2024年中旬之后,开源社区普遍采用:“纯文本 + 图文对 + 指令微调 + 推理增强”的联合训练,可以提升模型的综合性——这个问题被称为“多模态灾难性遗忘”。我见过一个团队不控制图文比例,只堆图像数据,结果模型一个月后连基本的问答都开始胡说八道。后来把文本数据比例恢复到25%左右,模型才回正常,而且亮点是多模态指标也没掉多少。这个配比经验对不同规模模型有差异,但核心原则相同:文本是底子,图像是增量。
数据工程还有一个坑:Crop策略。同一张图,中心裁剪和随机裁剪对模型学到的东西影响很大。你的模型如果经常处理长图、截图,不在数据里有针对性地做整图输入,到线上就会出现“图片一长就乱答”的毛病。现在很多论文单独讨论多视图、拼图、稀疏采样,其实都是在解决这个数据分布问题。
3. 从多模态到 Reasoning Agent:推理能力的跃迁
3.1 为什么纯对齐做不出推理
2024年的Fusion模型能回答“图上有什么”,但很难回答“图上这个人下一步会做什么”。原因在于,融合模型学到的更多是统计相关,而不是因果链或状态转移。你让它识别一张包含杯子和桌子的图,它能说对;你问它“杯子摔下来会怎样”,它往往给不出合理解释——因为它没有学过程度推理的中间过程和物理常识。
当时OpenAI的o1模型发布,让整个多模态社区意识到“推理”可能是下一个重要Hi级任务。o1带来的核心思路是:推理长链(CoT)不只是提示词技巧,而是可以用强化学习训练出来的。于是2025年开始,多模态领域出现了一大批把RL引入视觉推理的论文,比如LMM-R1,它把DeepSeek的GRPO算法移植到多模态模型上,让模型通过试错和奖赏信号学会“先看了图片再说”。
我自己跑了LMM-R1的开源版本,发现一个有意思的现象:推理能力的出现,往往伴随着模型会先输出一段OCR或者定位信息,再去推理。这对Fusion时代的对齐训练来说毫无必要,但对推理模型来说却可能是关键——因为定位和OCR是低层次的“证据”,是模型用来支撑后续推理的基石。
3.2 多模态推理的层级划分
读2025年的多模态推理论文,建议先建立层级意识。我把它们分成了四层:感知层、基础推理层、复杂规划层和反思层。
感知层解决“能不能看清楚”,对应高分辨率、OCR、视觉定位这些能力;基础推理层解决“一句话能不能判断”,比如空间关系、属性比较、常识问答;复杂规划层解决“多步怎么办”,比如让模型根据桌面上的食材规划一个烹饪流程;反思层则是“发现我错了再修正”,目前在多模态模型上还非常不成熟。
现在的Benchmark也是一层一层垒上去的。MathVista测基础推理,MMMU测学科知识理解,SEED-Bench和BLINK测感知和时序,而像DART这样的数据集已经开始测“多模态规划”了。我之前用DART测了几个主流开源模型,结果发现大多数模型在第一步“理解图形中的规则”就挂掉,根本走不到规划。这说明推理不是某一个模块能解决的,而是感知、语言、规划全链路的问题。
从论文阅读的角度,我建议重点关注复杂规划层的工作。比如使用MCTS(蒙特卡洛树搜索)在多模态空间里搜索推理路径,或者用A*式的算法去展开视觉计划树。这些方法虽然现在还很慢,但它在某种意义上把“推理”变成了“可搜索的问题”,这比直接指望模型抖机灵要可靠得多。
3.3 让 Agent 真正“基座化”的做法
2025年下半年起,业界越来越多地讨论一个词:Agentic Base Model。意思是模型本身不应该只是“回答问题的底座”,而应该是一个能自主拆解任务、调用工具、观察反馈并规划下一步的Agent基座。多模态在这个方向上的价值特别明显:因为Agent不光要看文本,还要看屏幕截图、摄像头画面、GUI界面,甚至要在网页上点按钮做操作。
这个方向上有几类重要工作。一类是UI Agent,比如OS-Atlas和UI-TARS,把操作系统的截图作为视觉输入,让模型输出“点击哪个坐标、输入什么文本”。另一类是“视触觉融合Agent”,把机械臂的触觉信号和摄像头画面结合起来做精细操作,这在机器人领域比较热。还有一类是“多模态记忆Agent”,模型会将历史交互中的视觉信息做压缩和索引,在长会话里能调出之前见过的图片,真正做到“我记得你上次给的菜谱”。
我在一个内部项目里试过类似方案,把浏览器截图直接发给一个支持视觉输入的LLM,配一个Python脚本让它提炼页面信息并出操作。效果比预期好,但有限的教训是:Agent上下文窗口还是不够长——截图动辄几千Token,要把页面缩小只能降清晰度,一降清晰度又失去了OCR能力。所以现在很多论文在做“紧凑视觉表征”,把关键区域的像素特征压缩成一个“场景摘要”。这个方向非常值得关注,因为它直接决定了Agent的任务上限。
讲到Reasoning Agent,还必须提一句RL。传统SFT能训练模型按格式输出,但模型不会自己纠错。真正让Agent学会“这条路走不通就换一条”的,是强化学习提供的探索和奖惩信号。当前主流做法是:先拿大量SFT数据让模型学会基本动作,再用RL去优化决策策略,最后用环境模拟器或真实点击反馈做在线对齐。这个链路已经是Agent基座模型训练的标准配置了。
4. 世界模型:多模态的下一个主战场
4.1 世界模型不是“预测下一帧”
世界模型这个词这两年被用烂了,很多做视频生成的人把“预测下一帧”叫做世界模型,这个混淆挺大的。严格的World Model,核心是学到环境的“状态转移函数”:给你一个状态和一个动作,你预测出下一个状态。视频帧只是状态的一种表现形式,物理规则、因果推理、物体交互和空间一致性才是世界模型真正要学的。
2024年的Genie 2把token化世界模型做到了交互式,用户可以用键盘控制Agent在生成的3D场景里走,模型实时生成第一人称视角的画面。它不是在做纯视频预测,而是在维护一个虚拟世界状态——你向左走,墙壁会移动,门会打开,物体具备“可见但不可穿”的性质。这才是世界模型的意义。
UniSim也很有代表性,它把自动驾驶、机器人操作和游戏场景统一到一个仿真平台里,让模型在这些环境里做“想象”,然后通过对比真实的观测结果来更新世界模型,就跟人类在脑子里先预演一遍再动手一样。
4.2 当前几条务实路线
从我实际跟进的论文看,世界模型目前有几条路线比较务实。
第一条是“离散Token世界模型”:把视频帧离散化成Token序列,用自回归Transformer预测下一帧Token。Genie 2和部分MOFA工作是这个思路。优势是能直接复用LLM的完整基建,劣势是Token重建细节丢。
第二条是“Dynamic 3D + 物理引擎蒸馏”:模型不是从像素里学物理,而是先用一个可微的物理引擎生成轨迹,再蒸馏到神经网络里。这套方案比较适合机器人操控,因为它的泛化性和样本效率都比直接从视觉学要高。
第三条是“将世界模型嵌入LLM作为想象模块”:LLM决定“动作计划”,世界模型负责“展开结果”,再让LLM根据展开的结果修正计划,形成一个闭环比对(Imagine-Assess-Correct)。这相当于给语言模型加了一个内部模拟器。
这三条路线不是互斥的。2026年前后的论文里,出现了很多“视频生成模型+世界模型”的混合体。比如HoloWorld,就是把视频生成和多模态世界模型统一在一个框架内,让你既可以用文字生成视频片段,也可以反过来用一段视频推导出状态的转移。
我在复现过程中体会最深的是:世界模型的评测非常麻烦,你不能只看生成画面的美观度,要看“状态一致性”。给你一叠多米诺骨牌的视频,你推倒第一张,后面的牌是不是按物理规律依次倒下?这个评测标准和视频生成评估完全不同,需要自己设计可控场景。目前社区里已经有WMB(World Model Benchmark)之类的评测集,但覆盖范围仍很有限。
4.3 和 LLM 结合的工程路径
世界模型真正想做产品,最后还是要跟LLM结合。目前比较主流的工程化路径是“Action - World Model - Plan”的三段式:
模型先用视觉感知模块把当前的观测转成结构化状态(比如场景图/物体列表),然后交给世界模型做状态推演,最后再让语言模型根据推演结果生成自然语言指令或计划文本。整个过程里,多模态的职责就从“理解”变成了“想象”。
我实操过一套简化版,直接用World Model的隐状态接LLM的跨注意力层,让语言模型在生成答案时可以“想象”多种情况再选。这个方向做起来很费显存,因为世界模型和LLM都在生成,显存量相当于跑两个大模型,所以我们当时压缩了世界模型的分辨率,只在LLM做高层次的语义选择时接入。效果依然能感受到,尤其是在常识问答这类需要物理直觉的任务上,模型会比纯LLM少犯很多低级错误。
这个方向可能在多模态评价体系里会延伸出更多“预测与规划”类任务。如果你做的是机器人、自动驾驶、具身智能,世界模型的价值会更高——因为它让模型在面对新环境时,不再是“答不对就瞎猜”,而是能够先在脑子里“试一遍”。
5. 论文阅读方法与实践心得
5.1 三年时间线阅读法
既然都是做这个方向的研究者,我可以和你聊聊我这两年的读论文方法论。纯按时间顺序读是本末倒置,我推荐“三年时间线阅读法”。
第一步,先读2024年的Fusion代表作,搞清楚多模态的基本问题定义。LLaVA、InternVL、Qwen2-VL、MiniCPM-V,各挑一篇精读,只读代码不读论文也行,但一定要把“输入图像怎么变成Token”“这些Token怎么和文本融合”这两条链路彻底弄明白。这一步是在打地基。
第二步,跳到2025年读Token化和统一模型,NExT-GPT、Emu3、Chameleon这几篇必看。重点看它们怎么处理“图像生成和文本生成的损失平衡”,以及“离散Token重建质量问题”。看完你会发现,很多Fusion时代的争论,在这个框架下根本不存在,因为全部统一成一个自回归问题了。
第三步,读2026年前沿那批Reasoning Agent和World Model的论文。注意力放在RL训练细节、世界模型评测设定和Agent可交互场景上。因为这部分论文的很多结论还挑战着所在领域的共识,你读的时候保持批判:它到底是真的有效,还是只是数据集刷得好?
5.2 复现与评估中的坑
复现多模态论文,我有一些“过来人”的经验可以分享。
第一个坑是数据配比复现不出来。很多论文不在正文里写清楚到底给了模型多少文本数据、多少图像数据,只在附录里给个表格,甚至只给个总样本数。你按他们代码仓库的默认配置跑,效果往往对不上。遇到这种情况,我一般会去翻他们的DataMix,重点看文本token和图像token的比例,然后自己做个消融,调整到自己数据集的效果最好为止。
第二个坑是评估指标选择。多模态模型的评测,特别是开放式问答的评测,自动指标和人工指标经常打架。CLIPScore和G-Eval评分高不代表模型答得对,因为评测模型本身也会被输入文本的长度和风格带偏。建议每跑一个实验,都抽20到50个case自己看一遍。这个工作量和训练也差不多,但训练冒了这么多GPU成本,不人工抽检一下真的亏。
第三个坑是Token压缩。视觉Token动不动上千,模型上下文一下就满。很多论文里的Tail-Free或Token Merging看起来很美好,实际一测,在小目标检测和OCR场景下半数都会失效。做业务的时候,宁可先做两阶段:先让模型定位,再让模型用高分辨率的局部区域做识别,都比直接压缩视觉Token稳。
5.3 一些选题建议
对于准备在这个方向上发力的人,我琢磨了一下,觉得还有几类工作值得跟进:
一是“视觉Token压缩+细粒度重建”的组合。这个方向目前看起来研究得还不足,但产品需求非常真实——电子文档、截图理解、医学影像,全都要高保真的小Token。
二是“多模态Agent的长会话记忆”。很多Agent模型在单轮截图理解上已经做得不错,但一到长会话就抓瞎,因为你没法把半个小时的视频都塞进上下文里。怎么在会话中动态维护视觉记忆,是很值得做的方向。
三是“世界模型下的安全性与幻觉评估”。世界模型生成的内容越真实,潜在风险也越大。未来社区需要一套标准来评估模型是否将用户引导到不安全的物理操作上——这个方向既冷门,又十分重要。
四是在“Fusion的遗留问题”上做修补:比如多语言多模态对齐、音视频联合理解、端侧轻量化推理。这些方向虽然不那么性感和显眼,但在工业界的需求量一直向上走,反而比那些一线研究者扎堆的地方更容易出成果。
我个人的体会是,2024到2026这三年,是多模态从“会看”走向“会想”的三年。Fusion阶段把各种模态接到了语言模型身上,Token化阶段让它们共享了同一套序列范式,而Reasoning Agent和World Model则让模型不再满足于“回答”,开始学会“行动”和“预测”。这个变化对做研究的人来说是机会,对做产品的人来说更是机会——因为旧的问题在换框架,新的问题也在不停冒出来,谁先啃下其中一块硬骨头,谁就能在下一轮竞争里占住身位。