「从"看懂世界"到"与世界互动"」
目录
01 自动驾驶、场景生成与三维感知
1. 优化引导的交互式场景生成扩散模型
2. 世界引擎:迈向自动驾驶后训练时代
3. PlannerRFT:通过闭环和样本高效微调强化扩散规划器(CVPR 26)
4. SimScale:通过大规模真实世界模拟学习驾驶(CVPR 26)
5. 测试时修正:一种通过视觉提示的在线 3D 检测系统(T-PAMI 26)
6. LatentVLA:从视觉-语言模型中学习未来感知的潜在表征用于自动驾驶
02 机器人学习、操作与触觉数据
7. RISE:基于组合世界型的自改进机器人策略(RSS 26)
8. NativeMEM:用于长周期机器人操作的原生内存压缩
9. FreeTacMan:用于接触式操作的无机器人视觉触觉数据采集系统
10. TAMEn:用于接触密集型任务闭环数据收集的触觉感知操作引擎
11. 可扩展机器人操作中多样性是否为关键要素?(T-RO 26)
03 人形机器人、运动控制与具身导航
12. RoboNaldo:通过运动引导的课程强化学习实现人形机器人足球射门的精准、稳定与强大
13. 敏捷性与稳定性兼备:基于异构数据的多功能人形机器人控制(ICRA 26)
14. WholeBodyVLA:迈向全身运动操作控制的统一潜变量视觉-语言-动作模型(ICLR 26)
15. 稀疏视频生成推动真实世界超视距视觉-语言导航
04 写在最后
2026年7月,RSS 2026将"青年成就奖"颁给了香港大学助理教授李弘扬。
李弘扬成为这一荣誉设立22年来首位获奖的国人学者。
从自动驾驶领域到具身智能,从2022年百强影响力AI论文BEVFormer、CVPR 2023最佳论文UniAD(近十年来大陆学术机构唯一获此奖项的工作),再到具身百万真机数据集AgiBot World、创立源策未来,并明确提出全身智能(WBI)的技术方向。
从"看懂世界"到"与世界互动",李弘扬团队(OpenDriveLab)2026年的15篇代表性工作,正是这条轨迹的最新截面。
下文按三个方向逐一拆解。
01 自动驾驶、场景生成与三维感知
1. 优化引导的交互式场景生成扩散模型
图 1|OMEGA 在扩散生成过程中注入交互约束,以生成更符合物理与行为逻辑的安全关键场景。
论文标题:Optimization-Guided Diffusion for Interactive Scene Generation
论文介绍:自动驾驶评估中,现实多样的多智能体驾驶场景至关重要。然而,现有数据集中安全关键事件稀少且代表性不足,而现有模型生成的场景往往缺乏可控性,或容易生成违反物理与社会约束的样本。
OMEGA 提出了一个优化引导的无训练框架。该方法通过约束优化重新锚定每个逆扩散步骤,确保扩散模型在场景生成过程中保持结构一致性和交互感知。特别是,它将自我—对手交互建模为分布空间中的博弈论优化,从而能够生成逼真且安全关键的对抗性场景。
实际测试中,OMEGA 能够大幅提升生成场景的物理合理性与可控性。它不仅能让生成的车辆行为更符合现实逻辑,还能高效“导演”出大量极具挑战性的近碰撞危险场景,为自动驾驶系统的压力测试提供了丰富的素材。
论文链接:https://arxiv.org/pdf/2512.07661
2. 世界引擎:迈向自动驾驶后训练时代
图 2|World Engine 从真实驾驶日志重建交互环境,生成安全关键变体并用于策略后训练。
论文标题:World Engine: Towards the Era of Post-Training for Autonomous Driving
论文介绍:现代端到端驾驶策略在常规场景中表现出色,但其可靠性严重受限于真实驾驶数据集中安全关键“长尾”事件的稀缺性。单纯扩展预训练数据,在应对这些罕见事件时往往收益递减。
论文提出了 World Engine 生成式框架,能够从真实世界日志中重建高保真交互环境,并系统地推断出逼真的安全关键变体。该范式通过基于强化学习的后训练,使策略与安全约束对齐,从而规避了在真实世界中进行安全探索固有的物理风险。
在公共基准测试中,这种“在脑海中演练危险”的后训练方式,让自动驾驶策略在面对罕见的危急情况时更加从容,其带来的安全收益远超单纯堆砌常规的预训练数据。
论文链接:https://arxiv.org/pdf/2606.19836
延伸解读:港大&华为开源World Engine:加塞碰撞降45.5%、200km零接管!
3. PlannerRFT:通过闭环和样本高效微调强化扩散规划器(CVPR 26)
图 3|PlannerRFT 同时优化轨迹分布与去噪引导,使扩散规划器能在闭环中进行更高效的探索。
论文标题:PlannerRFT: Reinforcing Diffusion Planners through Closed-Loop and Sample-Efficient Fine-Tuning
论文介绍:扩散模型在生成自动驾驶轨迹时,往往难以产生多模态且自适应场景的结果。同时,在微调过程中,这些规划器对信息奖励的利用效率低下,容易导致模式崩溃。
PlannerRFT 提出了一种双分支优化方法,在微调扩散规划器时,同时优化轨迹分布并自适应地引导去噪过程,以实现更有效的探索。为了支持这种强化微调,团队还开发了 nuMax 模拟器,其速度比 nuPlan 快 10 倍,能够支持大规模并行闭环学习。
经过这种闭环强化微调后,扩散规划器不仅能构思出多种合理的行驶路线,还能在面对复杂路况时做出更敏捷、更可靠的规划决策。
论文链接:https://arxiv.org/pdf/2601.12901
4. SimScale:通过大规模真实世界模拟学习驾驶(CVPR 26)
图 4|SimScale 从真实驾驶日志合成未见状态,并通过伪专家轨迹为驾驶策略提供监督。
论文标题:SimScale: Learning to Drive via Real-World Simulation at Scale
论文介绍:实现完全自动驾驶系统需要学习在各种场景下的合理决策,但安全关键和分布外场景在真实世界数据中代表性不足,单纯收集真实数据难以覆盖所有边界情况。
本文引入了一个新颖且可扩展的模拟框架 SimScale,能够基于现有驾驶日志合成大量未见状态。该框架利用先进的神经渲染和反应式环境生成高保真多视角观测,并开发了伪专家轨迹生成机制,为端到端模型提供动作监督。
在真实世界的基准测试中,得益于这种大规模的虚拟数据“喂养”,自动驾驶模型在应对困难导航场景时的表现获得了显著提升。
论文链接:https://arxiv.org/pdf/2511.23369
5. 测试时修正:一种通过视觉提示的在线 3D 检测系统(T-PAMI 26)
图 5|TTC 利用视觉提示驱动在线适配器,并通过提示缓冲区持续修正三维检测结果。
论文标题:Test-time Correction: An Online 3D Detection System via Visual Prompting
论文介绍:传统的离线 3D 检测器在推理时无法在线纠正错误,导致自动驾驶系统在面对新场景或分布偏移时适应性差,存在将错误传递给下游规划模块的风险。
本文提出了测试时修正(TTC)系统,通过为现有 3D 检测器配备即插即用的在线适配器(OA)模块,实现实时错误纠正。OA 模块利用视觉提示(如来自 2D 检测、道路描述或用户点击的辅助反馈)生成查询,并维护一个视觉提示缓冲区以实现连续修正。
TTC 系统就像给自动驾驶感知模块配了一个“在线纠错员”。它完全不需要重新训练庞大的主干网络,就能在车辆行驶过程中实时发现并修正漏检或误检,让模型在面对从未见过的陌生场景时依然稳健。
论文链接:https://arxiv.org/pdf/2412.07768v3
6. LatentVLA:从视觉-语言模型中学习未来感知的潜在表征用于自动驾驶
图 6|FLARE 以未来特征预测激活视觉语言模型的潜在表征,并将其用于驾驶规划。
论文标题:LatentVLA: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving
论文介绍:当前自动驾驶方法过度依赖劳动密集型的语言标注来连接感知与控制,导致离散语言与连续驾驶轨迹不匹配,影响了控制策略的平滑性和预训练知识的利用效率。
FLARE(或 LatentVLA)框架通过自监督未来特征预测目标,在无需语言监督的情况下激活预训练视觉-语言模型(VLM)的视觉语义能力。该机制促使模型直接在潜在空间中预测场景动态和自车运动,从而从大规模未标注轨迹数据中学习鲁棒的驾驶表征。此外,团队还将群组相对策略优化(GRPO)整合到规划过程中以提升决策质量。
测试表明,通过这种自监督方式“榨取”出的视觉语言模型潜力,让自动驾驶的规划能力达到了全新的水平。
论文链接:https://arxiv.org/pdf/2601.05611
02 机器人学习、操作与触觉数据
7. RISE:基于组合世界型的自改进机器人策略(RSS 26)
图 7|RISE 以组合世界模型预测未来状态,并通过价值评估为策略改进提供闭环信号。
论文标题:RISE: Self-Improving Robot Policy with Compositional World Model
论文介绍:视觉-语言-动作(VLA)模型在接触密集和动态操作任务中表现脆弱,由于缺乏闭环反馈,微小的执行偏差往往会导致任务彻底失败。
RISE 提出了一个可扩展的机器人强化学习框架,其核心是组合世界模型。该模型通过可控动态模型预测多视角未来,并用进度价值模型评估想象结果。这种想象驱动的评估机制为策略改进提供了闭环信号,使机器人在无需密集真实交互的情况下实现自我提升。
在诸如动态砖块分类、背包打包等真实世界的复杂任务中,这种基于想象的自我反思机制让机器人的操作成功率获得了跨越式的提升。
论文链接:https://arxiv.org/pdf/2602.11075
8. NativeMEM:用于长周期机器人操作的原生内存压缩
图 8|NativeMEM 将长时视觉历史压缩为紧凑记忆 token,使预训练 VLA 可在低开销下利用历史信息。
论文标题:NativeMEM: Native Memory Compression for Long-Horizon Robotic Manipulation
论文介绍:预训练视觉-语言-动作模型(VLA)在处理长周期机器人操作时,面临如何在保持推理效率的同时有效保留长时视觉历史的挑战。
NativeMEM 提出了一种高效的内存编码方案,它复用 VLA 自身的视觉编码器,将每个历史帧压缩为单个记忆 token。这些紧凑的记忆 token 使预训练 VLA 能够以极低的开销处理长期历史,无需依赖外部规划器或重新初始化的记忆模块。
得益于这种高效的记忆压缩技术,机器人在执行长步骤任务时不再“健忘”,成功率实现了翻倍式的增长,而且几乎没有增加额外的计算和内存负担。
论文链接:https://arxiv.org/pdf/2607.06678
9. FreeTacMan:用于接触式操作的无机器人视觉触觉数据采集系统
图 9|FreeTacMan 通过可穿戴视觉触觉夹持器与光学追踪系统采集接触密集操作数据。
论文标题:FreeTacMan: Robot-free Visuo-Tactile Data Collection System for Contact-rich Manipulation
论文介绍:机器人在接触密集型操作中的学习主要受限于数据收集效率低下和传感器设置不足,传统的遥操作数据往往缺乏高质量的触觉反馈。
FreeTacMan 提出了一个以人为中心、无机器人的数据采集系统。该系统设计了一个可穿戴的、带有视觉触觉传感器的夹持器,可由人手佩戴进行直观控制,并通过高精度光学跟踪系统同步捕获末端执行器姿态及多模态反馈,从而高效收集高质量操作数据。
测试结果显示,用这套系统收集的带有丰富触觉反馈的数据,能够极大地帮助机器人掌握接触密集型技能;相比于只靠“看”的纯视觉方法,机器人的操作成功率有了质的飞跃。
论文链接:https://arxiv.org/pdf/2506.01941
10. TAMEn:用于接触密集型任务闭环数据收集的触觉感知操作引擎
图 10|TAMEn 将跨形态可穿戴界面、视觉触觉数据和人机协作恢复数据连接为闭环采集管线。
论文标题:TAMEn: Tactile-Aware Manipulation Engine for Closed-Loop Data Collection in Contact-Rich Tasks
论文介绍:现有手持数据采集范式在接触密集型双臂操作中面临硬件适应性、数据效率以及交互式恢复数据收集困难的挑战。
TAMEn 是一个触觉感知操作引擎,通过跨形态可穿戴界面实现异构夹持器的快速适应。它采用双模态数据采集管线,结合运动捕捉和 VR 追踪,并整合大规模触觉预训练、双臂演示和人机协作恢复数据,以实现闭环策略优化。
这套触觉感知操作引擎彻底打通了双臂协同任务的数据瓶颈。有了它采集的高质量闭环数据,机器人在面对复杂双臂操作时的成功率得到了大幅改善。
论文链接:https://arxiv.org/pdf/2604.07335
11. 可扩展机器人操作中多样性是否为关键要素?(T-RO 26)
图 11|GO-1-Pro 从任务、实体和专家三类多样性分析机器人数据扩展,并通过分布去偏提高数据效用。
论文标题:Is Diversity All You Need for Scalable Robotic Manipulation?
论文介绍:在机器人操作领域,有效数据扩展的原则尚不明确,尤其是“数据多样性”对模型泛化能力的具体贡献和潜在负面影响缺乏系统分析。
该研究(GO-1-Pro)通过分析任务、具身实体和专家三个维度的数据多样性,探讨其在机器人学习中的作用。研究发现,专家数据的多样性会导致速度多模态性(即同一任务存在不同速度的演示),从而混淆策略学习。为此,论文提出了一种分布去偏方法来缓解这种模糊性。
应用这种分布去偏方法后,机器人操作模型就像被“打通了任督二脉”,其带来的性能飞跃甚至相当于凭空多“喂”了两倍半的预训练数据。
论文链接:https://arxiv.org/pdf/2507.06219
03 人形机器人、运动控制与具身导航
12. RoboNaldo:通过运动引导的课程强化学习实现人形机器人足球射门的精准、稳定与强大
图 12|RoboNaldo 从稳定踢球先验出发,逐步学习任意球适应与移动球射门。
论文标题:RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning
论文介绍:现有方法难以使人形机器人在足球射门中同时具备稳定性、高冲击力和准确性,尤其是在适应不同球位、移动球和击球时机方面存在极大挑战。
RoboNaldo 提出了一个三阶段运动引导的课程强化学习框架。首先学习稳定的全身踢球先验,然后适应任意位置的静止球任意球设置,最后通过高层运动指令和踢球触发接口,将能力扩展到复杂的移动球射门。
通过这种循序渐进的课程学习,人形机器人在模拟足球场上展现出了惊人的运动天赋:不仅射门精度大幅提高,踢球的力量和速度也远超现有的常规控制方法。
论文链接:https://arxiv.org/pdf/2606.11092
13. 敏捷性与稳定性兼备:基于异构数据的多功能人形机器人控制(ICRA 26)
图 13|AMS 将动作捕捉与物理约束合成数据结合,统一训练动态技能与极限平衡行为。
论文标题:Agility Meets Stability: Versatile Humanoid Control with Heterogeneous Data
论文介绍:在人形机器人控制中,现有方法要么专注于敏捷动态技能,要么专注于稳定性关键行为,很难在单一策略中兼顾这两者。
AMS 框架通过结合人类运动捕捉数据集和物理约束的合成平衡运动数据,统一了动态运动跟踪和极限平衡维护。该方法设计了混合奖励机制和自适应学习策略,以有效训练涵盖极端平衡与高机动性的多样化运动分布。
得益于这种异构数据的融合训练,研究人员成功在一个策略下让人形机器人变成了“全能选手”:它不仅能像运动员一样奔跑跳舞,还能稳稳地做出“叶问蹲”、单腿站立等挑战极限平衡的动作。
论文链接:https://arxiv.org/pdf/2511.17373
14. WholeBodyVLA:迈向全身运动操作控制的统一潜变量视觉-语言-动作模型(ICLR 26)
图 14|WholeBodyVLA 从人类视频中学习统一潜变量监督,并通过 LMO-RL 策略执行稳定的全身运动操作。
论文标题:WholeBodyVLA: Towards Unified Latent VLA for Whole-Body Loco-Manipulation Control
论文介绍:现有的人形机器人方法在操作感知型运动方面存在不足,往往将移动与操作割裂,导致机器人工作空间受限,无法进行大范围的全身运动操作。
WholeBodyVLA 提出了一个统一的潜变量学习框架,使视觉-语言-动作(VLA)系统能从低成本的无动作自我中心视频中学习。它不仅设计了高效的数据收集流程来扩充数据集,还引入了面向运动操作的强化学习(LMO RL)策略,以将潜动作准确解码为底层控制指令。
在真实的人形机器人上,这套统一潜变量框架彻底打破了“边走边做”的瓶颈,让机器人在执行大范围、跨区域的全身运动操作时显得更加游刃有余。
论文链接:https://arxiv.org/pdf/2512.11047
15. 稀疏视频生成推动真实世界超视距视觉-语言导航
图 15|SparseVideoNav 生成稀疏未来帧,将视频生成模型的长时信息用于超视距导航推理。
论文标题:Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation
论文介绍:现有的视觉-语言导航方法过度依赖详细的语言指令,难以在真实世界中实现自主导航,尤其是在超出当前视野(BVN)的长周期任务中。
SparseVideoNav 首次将视频生成模型引入超视距导航任务,利用其长时序监督的优势来对齐语言指令。为解决视频生成的高延迟问题,该方法通过生成 20 秒稀疏未来帧,在保证长时规划能力的同时实现了亚秒级的轨迹推理。
在真实世界的复杂环境中,这种具备“预见未来”能力的导航系统展现出了压倒性的优势。它不仅能更准地找到视距外的目标,甚至在极具挑战的夜间场景中也首次实现了可靠的自主导航。
论文链接:https://arxiv.org/pdf/2602.05827
04 写在最后
李弘扬在悉尼的获奖演讲里,讲了一个很有意思的观点。
他说,大部分人都不太看好全身智能,"觉得很难"。更多人想的是一条更安全的路:先把灵巧手做好,或者先把底盘控制做稳,等条件成熟了再去谈全身协调。这些想法都有道理,但他不打算等。
"真正重要的问题,往往在一开始都不是主流。"
从2026年这15篇工作的分布来看,他确实在用行动兑现"不等待":
当真实世界的数据不够用,就合成它;当采集数据的工具不够好,就造工具;当单一技能不够用,就打通全身协调。
每一步都在回答"智能体如何在不完美的世界里自我进化"。