26年9月来自富士公司和CMU的论文“Toward Unified Robot Learning: Bridging Representation, Vision-Language-Action, and World Models”。
这篇论文最有价值的贡献,是把机器人学习中的环境表征、动作生成和未来预测放进同一个分析框架,说明很多失败发生在三者的连接处。它提供了较清晰的研究地图,但“如何统一、统一到什么程度、收益是否超过代价”仍主要停留在研究主张和定性分析层面。
如图 1 所示融合感知、动作与推理的理想且鲁棒的现实世界机器人学习概览。
论文的核心命题是:机器人需要把“理解环境、决定动作、预测后果”组织成持续更新的闭环。
作者认为,当前研究大致沿三条路线发展:
| 技术方向 | 要回答的问题 | 主要输出 | 单独发展时的局限 |
|---|---|---|---|
| 表征学习 | 环境中有什么?哪些信息与任务有关? | 场景特征、几何结构、历史记忆或状态估计 | 视觉上有区分度的特征,未必适合控制 |
| 视觉—语言—动作模型,VLA | 根据观察和指令,机器人应该怎样行动? | 单步动作、动作序列或动作分布 | 可以模仿行为,却未必可靠地预测行为后果 |
| 世界模型,World Model | 如果执行这些动作,环境将怎样变化? | 未来观测、潜在状态、奖励或物体运动 | 预测可能看起来合理,却不符合物理约束或机器人能力 |
这里的基础问题是部分可观测性:机器人通常只能看到图像、深度、触觉和自身关节状态,无法直接获得完整的真实环境状态。
因此,论文在第 2 节引入三种相关但不同的信息:
- 交互历史 h_t:过去的观察与动作。
- 学习表征 z_t = phi(h_t):对历史中有用信息的压缩。
- 信念状态 b_t = p(x_t|h_t):对真实状态有哪些可能性的概率描述。
例如,物体被机械臂遮住之后,可靠系统仍需要保留“它可能在哪里、是否已经移动”的判断,并让这一判断影响接下来的动作。
作者所说的“统一”,包括共享表征、联合训练目标、预测反馈和不确定性传递。模块化架构也可以实现统一,关键在于模块之间的信息是否真正影响决策。模仿学习和强化学习则是训练范式,可以用于上述不同组件,并不与三条主轴处于同一分类层级。
环境表征部分关注的是:什么信息值得保留,才能同时支持动作与预测。(第 4 节,第 14—18 页)
如图 3 所示机器人学习中环境表征的演变。
论文按照从低维状态到几何与时序信息的扩展,梳理了以下路线:
| 表征形式 | 主要价值 | 主要限制 |
|---|---|---|
| 低维状态与本体感知 | 关节位置、速度、力矩等结构清晰,便于控制,计算成本较低 | 外部环境状态往往需要另外估计;自身状态不能代表完整场景 |
| 单视角二维图像 | 能从原始视觉输入学习语义、物体关系和可操作性 | 深度、遮挡和运动信息不充分,容易受背景与视角影响 |
| 多视角表征 | 利用不同视角补充被遮挡信息,改善空间理解 | 增加传感器、标定、融合和计算成本 |
| 三维几何表征 | 点云、体素、隐式几何等能够明确表达空间结构 | 高分辨率处理成本较高,几何信息也不等于完整动力学 |
| 时序与四维表征 | 表达场景如何随时间变化,支持运动理解和未来预测 | 历史压缩、长期一致性和实时处理仍然困难 |
其中涉及的代表技术包括 CNN、视觉 Transformer、PointNet、NeRF、Gaussian Splatting,以及时序潜变量模型。
这一部分的重点并不是“输入维度越高越好”,而是:表征必须保留对任务后果有影响的变量。
例如,抓取任务可能需要保留物体姿态、接触位置和运动趋势,同时忽略无关背景纹理。一个能够重建漂亮图像的表征,如果丢失了滑动、接触或遮挡物体的信息,仍然可能无法支持可靠操作。
VLA 部分梳理了三种把视觉与语言信息转化为机器人动作的主要组织方式。(第 5 节,第 18—25 页)
第一种是直接预测动作的端到端 VLA。论文以 RT-1、RT-2、OpenVLA 等为代表,讨论如何将视觉观察、语言指令和机器人状态映射成动作。RT-2 一类方法利用视觉语言预训练获得的语义知识;3D-VLA、GeoVLA、PointVLA 等进一步引入空间几何信息。
这条路线的吸引力在于统一输入和输出接口。但语义理解与精确控制之间仍存在距离:理解“拿起杯子”,并不自动决定合适的抓取姿态、接触力和运动轨迹。数据需求、推理延迟和对具体机器人动作空间的依赖,也限制了迁移能力。
第二种是在多模态主干之后连接生成式动作头。主干负责理解场景和任务,动作头负责产生连续控制量或动作序列。
论文重点讨论两类方法:
- 扩散策略:从噪声出发,逐步生成符合当前观察和指令的动作序列。
- 流匹配策略:学习将噪声分布变换为动作分布的向量场,在适当设计下可以减少采样计算。
生成式动作预测的重要性在于处理多种有效行为。例如,绕过障碍物可以从左侧或右侧进行。如果用单一回归结果拟合这两类示范,可能得到穿过障碍物的平均轨迹;生成式策略可以保留不同动作模式。
但需要区分:能生成多条可选轨迹,不代表知道每条轨迹有多可靠。这也是论文后续强调动作置信度、风险评估和反馈控制的原因。
第三种是分层与推理增强的 VLA。高层先生成子目标、中间状态或任务步骤,低层再执行具体动作。论文讨论了 PaLM-E,以及引入语言推理、空间关系图和时空表征的后续工作。
这种组织方式适合长任务,但有两个突出问题:高层生成的步骤未必在当前物理条件下可执行;高层推理较慢,而底层控制需要及时响应。论文因此讨论了高层慢速更新、底层快速执行的组织方式,以及执行反馈如何反过来修正计划。
如图 4 所示基于视觉的机器人学习中确定性策略与生成式策略的比较。
如图 5 所示基于扩散与基于流的动作生成方法的比较。
世界模型部分最重要的区分,是“生成符合目标的未来”与“预测具体动作的后果”。(第 6 节,第 25—34 页)
语言条件世界模型根据当前场景和任务描述生成未来。例如,输入“把杯子放进盒子”,输出一段完成该任务的视频或潜在轨迹。论文讨论了 RoboDreamer、DreamGen 等工作。
其用途包括任务想象、子目标生成、合成数据和策略指导。但从未来视频得到机器人动作,通常还需要逆动力学模型或动作解码器。视频可能符合指令,却包含物体消失、刚体变形或机器人无法实现的接触过程。
动作条件世界模型输入具体动作或动作序列,预测环境怎样响应。它更直接地支持候选动作比较、模型预测控制、策略评估和想象空间中的强化学习。Dreamer 系列是论文讨论的典型路线。
作者特别指出,世界模型的价值不只在于预测图像。它也可以预测潜在状态、奖励、接触或物体运动。控制导向的模型可能不需要生成清晰视频,只要保留决定任务成败的动态信息。
世界—动作模型,WAM尝试联合生成动作与未来状态。论文列举了联合自回归预测、动作与视频双流网络、共享潜在空间等形式,并讨论 WorldVLA、LingBot-VA、MinD 等代表工作。
这类方法尝试让“准备做什么”与“预期会发生什么”保持一致,但仍面临动作标注数据不足、动作空间依赖机器人,以及长期预测漂移等问题。
世界模型作为模拟环境则是一类用途:在模型内部训练或改进策略,生成数据,评估动作,或者进行安全过滤。
它可以减少真实交互成本,但也产生新的风险:策略可能利用模型的预测漏洞,在想象中完成任务,却在真实环境中失败。因此,预测误差如何影响策略,是这条路线的核心问题。
这里还应保留一个边界:动作条件预测更适合研究动作后果,但仅仅输入动作,并不能保证模型已经学到了可泛化的因果机制。
如图 6 所示机器人学习中语言条件与动作条件世界模型的比较:
论文对“统一”的具体贡献,主要体现在整合机制与失败诊断的对应关系。(表 2、表 6,第 7、35 页)
| 整合机制 | 具体含义 | 希望改善的能力 |
|---|---|---|
| 表征—策略整合 | 用动作需求塑造表征,例如保留抓取相关几何和可操作性 | 感知真正服务于控制 |
| 表征—世界模型整合 | 让内部状态保留可预测的动态和物体关系 | 建立适合预测的状态抽象 |
| 策略—世界模型整合 | 利用预测结果评价、调整或优化动作 | 提前考虑后果 |
| 三者共同整合 | 通过共享状态、信念和执行反馈更新三者 | 形成一致的闭环决策 |
| 任务与机器人形态的抽象 | 分离任务目标和具体关节控制方式 | 跨机器人迁移 |
| 不确定性感知的整合 | 将可靠性估计传递给策略与预测模块 | 决定何时重规划、补充观察或保守执行 |
这个框架使论文超出了单纯罗列模型的层面。例如,机器人抓取失败,可以进一步诊断为:
- 表征没有保留关键接触信息;
- 策略生成了不适合当前物体的动作;
- 世界模型低估了滑落概率;
- 系统已经发现风险,但没有把风险传递给执行决策。
不同原因需要不同的改进方式,不能都归结为模型规模不足。
论文提出的五个开放问题,分别涉及可靠性、分布变化、机器人差异和时间跨度。(第 3 节,第 8—13 页)
| 开放问题 | 核心含义 | 论文强调的缺口 |
|---|---|---|
| 不确定性量化 | 系统需要知道当前判断和未来预测有多可靠 | 不确定性估计没有充分进入动作选择、信念更新与风险控制 |
| 分布外泛化 | 在新物体、场景、指令、传感条件或动力学下继续工作 | 视觉或语义相似,不保证原有操作方式仍然有效 |
| 跨机器人形态迁移 | 同一个任务由不同结构的机器人完成 | 任务意图与源机器人的动作空间绑定过深 |
| 长上下文理解 | 利用较早的观察和交互推断当前状态 | 缺乏有效的长期记忆、历史压缩与隐藏状态更新 |
| 长时域预测与规划 | 预见多步动作的后果并完成长任务 | 预测误差累积,子任务之间衔接脆弱,失败恢复不足 |
其中有两组区别尤其重要。
跨机器人迁移不是复制动作,而是保留预期的环境变化。夹爪与灵巧手完成“打开抽屉”时,动作可以完全不同。可迁移的知识更可能是目标、物体关系和交互效果,而不是原始关节轨迹。
长上下文理解面向过去,长时域预测面向未来。前者研究“之前发生的事情现在还有什么影响”,后者研究“现在的选择将怎样影响后续任务”。增加历史窗口或一次输出更长动作序列,都不能单独解决这两个问题。
数据与评估部分说明了三条路线为什么容易形成各自独立的研究体系。(表 3,第 9 页)
表征学习可以使用 ImageNet、COCO、Ego4D 等视觉或视频数据;VLA 更依赖 Open-X Embodiment、BridgeData V2、DROID 等带动作信息的机器人数据;世界模型需要能够支撑时序预测的交互轨迹。LIBERO、CALVIN、RLBench 等则承担不同类型的操作与泛化评估。
这些数据在动作标签、机器人覆盖、传感方式和任务范围上不一致,使“共同训练、共同评估”变得困难。
论文在第 7 节提出,整合效果应通过系统行为判断,例如:
- 不确定性是否经过校准,危险动作是否减少;
- 新物体、新动力学和新机器人上的表现是否改善;
- 遮挡后能否恢复状态,能否保留延迟依赖;
- 长任务成功率、扰动恢复和约束满足情况是否改善。
这是一组评估方向,论文没有据此建立统一的性能排行榜。
综述最值得抓住的五个要点,可以概括为以下几条。
- 把模块接口作为研究对象。任务信息、物理约束和不确定性,可能在模块之间传递时丢失。
- 让表征服务于交互后果。视觉重建质量和语义理解能力,不能充分代表控制价值。
- 区分语义泛化与物理泛化。理解新指令、识别新物体,与可靠完成新接触过程是不同能力。
- 区分多样性与可靠性。生成多种行为或未来,需要进一步配合置信度、风险评估和执行反馈。
- 用持续闭环检验统一程度。共享网络或联合输出只是实现形式,最终应检查系统是否更会记忆、预测、纠错和迁移。
论文据此提出的未来方向包括:
- 共享且适合控制的潜状态、
- 物体与关系层面的抽象、
- 概率信念更新、物理约束
- 在持续交互中学习并避免遗忘。
论文自身的问题,主要集中在论证强度、分类严谨性和可操作性。
- “缺乏整合是核心瓶颈”的论断合理,但尚未得到充分的因果验证。
论文提供了大量动机和代表案例,也提出了评估指标,但没有系统分离整合程度、数据规模、模型容量和训练方法各自带来的收益。因此,它支持“加强整合值得研究”,尚不足以证明整合不足是各种失败的主要原因。
更紧密的连接还可能传播错误:世界模型预测错误时,策略可能更坚定地执行错误动作。论文对何时需要紧耦合、何时保留独立模块更合适,讨论不够深入。 - 分类体系混合了不同维度,适合作为阅读地图,作为严格分类则边界不清。
“端到端”描述训练或输入输出组织,“生成式动作头”描述输出机制,“分层”描述决策结构;一个系统可以同时具有这三种属性。
世界模型分类也有类似问题:“语言条件”和“动作条件”描述条件输入,“WAM”描述联合建模,“模拟引擎”描述用途。这些类别会重叠。
此外,表征部分把 RGB 视频称为“3D Temporal”,容易让读者混淆二维图像加时间与显式三维几何。若将输入模态、几何结构、记忆机制和训练方式分开比较,分类会更精确。 - 文献选择和趋势统计的可复现性有限。
作者在第 4 页明确说明,这是代表性而非穷尽性综述,并交代了检索渠道、关键词和大致年份范围。这是合理的范围声明。
但论文没有完整报告检索式、精确截止日期、筛选数量和逐项编码规则。尤其图 7 使用论文数量展示趋势,却缺少足够明确的统计样本与归类细节。因此,该图适合说明作者观察到的趋势,不宜当作严格的领域计量结果。 - 诊断实验能够展示失败,但不足以证明失败的机制或普遍性。
第 33 页图 8 使用在 CALVIN 上微调的 Stable Video Diffusion 世界模型,展示遮挡物体未被保留,以及新动作条件下机械臂穿过桌面的现象。作者也明确承认,这只是小规模诊断实验。
论文没有给出充分的测试数量、失败率、重复实验、模型对照及记忆或物理约束的消融。因此,不能仅凭这些例子确定问题来自“缺少因果理解”,还是来自数据覆盖、输入历史、训练方式或模型容量。
遮挡例子还有一个关键条件需要澄清:如果模型从未观察过隐藏物体,也没有其他线索,就不能要求它准确恢复唯一真值;此时更合理的检验是它能否表达不确定性、利用历史或主动获取信息。 - 不确定性相关的概念和表格归类不够一致。
正文后半部正确指出,生成式动作的多样性不能替代可靠性估计。但前面的部分描述,又较直接地把扩散、流模型或更丰富的表征与“不确定性处理”联系起来,容易弱化以下区别:多峰行为分布、传感噪声、模型知识不足,以及置信度是否校准。
表 7 也存在对应不足:正文第 24—25 页已经讨论 VLA 的不确定性估计和干预机制,但表中 VLA 的不确定性栏目仍全部为空。虽然表注明确表示空白不等于文献不存在,这种选择仍会影响读者对研究分布的判断。 - 流匹配的效率优势被表述得过于一般化。
第 22 页将流匹配描述为沿直线路径变换分布,并强调常可单步生成。这里需要区分训练中构造的条件路径、学习后的采样轨迹,以及实际采用的数值求解步数。
流匹配并不天然意味着单步推理。原始流匹配论文仍通过 ODE 求解器采样;论文引用的代表性 VLA 模型 pi_0,其实使用了10 步积分。更准确的表述应是:流匹配在特定路径、训练和采样设置下可以提高效率,实际优势需要比较采样步数、延迟和任务成功率。 - 第 26 页的“通用世界模型训练目标”不够严谨,不能直接当作实现公式。
该公式将 KL 项写为模型潜在转移与“真实潜在转移”之间的差异,并称后者来自示范。但在一般部分可观测、潜变量学习场景中,示范并不会直接提供这个真实潜在转移分布。
以 Dreamer 的重建目标为例,KL 正则约束的是结合当前观测得到的潜在状态后验,与根据过去状态和动作得到的预测先验。这与对齐一个已知的真实潜在转移不同。此外,扩散、流匹配和无重建预测模型也不能直接由该公式统一概括。 - 从框架到实际系统设计,还缺少足够明确的取舍依据。
论文已经讨论实时性、校准、物理约束和持续学习,但尚未充分回答:共享哪些状态、哪些模块联合训练、预测多远、多久重规划,以及计算预算有限时应该优先保留什么能力。
其代表案例也主要集中在视觉驱动的操作任务。导航、腿足运动、高频力控、触觉主导操作和长期人机交互,尚未获得同等深入的综合分析。因此,使用这篇综述指导具体系统时,还需要补充对应任务的控制要求、数据条件与部署评估。