news 2026/9/24 17:46:21

τ0-VLA:一种基于世界模型引导测试时计算的分层机器人基础模型

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
τ0-VLA:一种基于世界模型引导测试时计算的分层机器人基础模型

26年8月来自上海创智学院、智元机器人和港中文的论文“τ0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation”。

其最有价值的贡献,是把长任务中的“下一步做什么”变成可增加推理预算的决策过程,并将它接入真实机器人的控制闭环。实验显示该方向有效,但对收益来源、物理预测可靠性和泛化能力的验证仍不充分。

一、主要方法:先预测子任务的后果,再决定执行什么

论文针对的是长时程操作中的两个不同难点:
执行问题:能否抓稳杯子、插入吸管、打开抽屉?
决策问题:现在该抓杯子还是拿勺子?盐是否已经加过?失败后应重试还是回退?

即使底层动作很精准,执行了错误的子任务,整体任务仍会失败。因此,其构建了高层决策、低层执行的分层系统。

1. 高层通过“提议—预测—评分—搜索—反思”生成子任务。

高层由四个模型组成:

如图1 所示τ0-VLA 概览。该高层策略利用由世界模型引导的推理时计算(test-time computation)来搜索子任务序列。在每次扩展步中,视觉-语言模型(VLM)提出候选子任务,世界模型预测其视觉结果,价值模型评估由此产生的任务进展。束搜索(beam search)保留有潜力的分支,随后反思模型根据保留的候选任务及其预测后果,确定执行下一个子任务。图中展示 N = 3 时的单次候选扩展过程;为简洁起见,省略递归至深度 D 的束扩展过程。选定的子任务随后作为输入,引导一个基于 40,115 小时异构真实世界数据训练而成的底层 VLA 策略,从而实现长时程移动操作、精确执行以及跨多种机器人形态的部署。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 17:46:16

PPT如何锁定部分对象?教你设置内容不可编辑

制作好的PPT发给同事或客户后,最担心的就是对方随意拖动图片、删除Logo、修改背景或打乱排版,导致精心设计的页面面目全非。很多人以为PPT没有类似Word的“部分限制编辑”功能,其实不然——PPT提供了多种灵活的保护方式,可以让你锁…

作者头像 李华
网站建设 2026/9/24 17:46:01

【Dify】门诊导诊智能应用

智能门诊导诊工作流结合大模型能力与自然语言处理,推动了分诊自动化和问诊体验升级。以问答为主线,依托多轮对话,系统能够自动采集并补全患者的关键就诊信息。 本文介绍门诊导诊智能工作流的核心模型、节点设计、运行机制与主要应用场景,梳理其技术细节和落地价值,为自学…

作者头像 李华
网站建设 2026/9/24 17:45:03

UA伪装进阶实战:动态UA池+浏览器指纹精准匹配,绕过现代反爬检测

最近在负责一个工业公开数据采集项目的优化工作,团队同事写的采集脚本明明加了UA轮换,却还是频繁触发目标站点的反爬机制,轻则返回403,重则直接弹出滑块验证码,IP封禁时长也越来越长。 一开始我们以为是IP代理的问题,换了好几拨代理资源都没有明显改善。直到用浏览器指纹…

作者头像 李华
网站建设 2026/9/24 17:44:34

产品经理懂点技术:前后端是如何“分家”的?

你清楚在早期的软件项目开发过程之中, 前端页面和后端业务逻辑代码其实是混合在一起, 并没有进行分离操作的吗? 那么紧接着后来业界又是因为什么样的原因促使二者走上了解绑的道路? 这种前后端分离的技术架构实施以后, 究竟为开发团队和用户带来了哪些看得见摸得着的优势与益…

作者头像 李华
网站建设 2026/9/24 17:44:32

为什么职员能工资20K?熟悉掌握了这些Python自动化办公模块

今天, 我将继续来给大家去分享一下这个自动化办公库, 而这个库是我花费了两周的时间去进行整理的。这次的这个内容, 它就是把那些库给说完了, 这些库里头, 包括了Excel、Word、PPT、ODF、PDF、邮件、微信、文件处理等所有能在办公场景实现自动化的库, 就是希望这些东西能够对大…

作者头像 李华