26年8月来自上海创智学院、智元机器人和港中文的论文“τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation”。
其最有价值的贡献,是把长任务中的“下一步做什么”变成可增加推理预算的决策过程,并将它接入真实机器人的控制闭环。实验显示该方向有效,但对收益来源、物理预测可靠性和泛化能力的验证仍不充分。
一、主要方法:先预测子任务的后果,再决定执行什么
论文针对的是长时程操作中的两个不同难点:
执行问题:能否抓稳杯子、插入吸管、打开抽屉?
决策问题:现在该抓杯子还是拿勺子?盐是否已经加过?失败后应重试还是回退?
即使底层动作很精准,执行了错误的子任务,整体任务仍会失败。因此,其构建了高层决策、低层执行的分层系统。
1. 高层通过“提议—预测—评分—搜索—反思”生成子任务。
高层由四个模型组成:
如图1 所示τ0-VLA 概览。该高层策略利用由世界模型引导的推理时计算(test-time computation)来搜索子任务序列。在每次扩展步中,视觉-语言模型(VLM)提出候选子任务,世界模型预测其视觉结果,价值模型评估由此产生的任务进展。束搜索(beam search)保留有潜力的分支,随后反思模型根据保留的候选任务及其预测后果,确定执行下一个子任务。图中展示 N = 3 时的单次候选扩展过程;为简洁起见,省略递归至深度 D 的束扩展过程。选定的子任务随后作为输入,引导一个基于 40,115 小时异构真实世界数据训练而成的底层 VLA 策略,从而实现长时程移动操作、精确执行以及跨多种机器人形态的部署。