news 2026/7/21 18:48:17

具身智能之Xiaomi-Robotics-1:如何把 VLA 的规模化落到真实机器人

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
具身智能之Xiaomi-Robotics-1:如何把 VLA 的规模化落到真实机器人

写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

Xiaomi-Robotics-1(下文简称XR-1)关注的不是为某一种机器人任务专门设计动作策略,而是一个更工程化的问题:机器人数据难以按语言模型和视觉模型的方式扩张时,VLA 的规模化应从哪里开始?

小米机器人团队给出的路线是两阶段训练。第一阶段使用超过100K 小时的 UMI(embodiment-free)真实操作轨迹预训练;这些轨迹由手持设备采集,不绑定特定机器人本体。自动标注流水线把长视频切成固定时长的片段,并用视觉语言模型描述夹爪和交互物体的状态转变。第二阶段再混合真实机器人、筛选后的开源数据和高质量 UMI 数据,将模型对齐到具体本体,并从“根据状态变化描述生成动作”转为直接执行自然语言指令。

论文的实证主线也很清楚:预训练数据量与模型尺寸增大时,验证动作误差持续下降;这种趋势在后训练后仍转移到陌生环境的真实机器人成功率。作者进一步报告,模型能用每个任务不足 10 小时的演示适应高难移动操作,并在 RoboCasa、RoboCasa365、VLABench、RoboDojo 四个仿真基准上取得领先结果。

猫先生认为,XR-1 最重要的启发是把“具身数据不够”转化成不受机器人本体绑定的真实交互数据可以先规模化。不过,规模曲线能否跨任务、跨机构和跨硬件复现,仍取决于数据采样、自动标注质量与后训练配比这些尚未完全公开的变量。

  • 论文标题:Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
  • 论文地址:https://arxiv.org/abs/2607.15330
  • 项目主页:https://robotics.xiaomi.com/xiaomi-robotics-1.html
  • GitHub:https://github.com/XiaomiRobotics/Xiaomi-Robotics-1
  • HuggingFace:https://huggingface.co/XiaomiRobotics

原文脉络

文章先把机器人策略的瓶颈定位为真实交互数据不足,再说明 UMI 轨迹、自动状态转变标注与两阶段训练如何构成可扩张的预训练—后训练配方。之后,论文依次给出预训练与真实机器人后训练的 scaling 证据,再用少样本下游适配和仿真基准测试模型的泛化能力。官方项目页与论文摘要共享这一论证顺序。

1-2. 具身模型为何需要一条不同于互联网数据的扩张路径

语言模型可以从网页文本中吸收大规模分布式知识,视觉模型可以从海量图文中学习表征;机器人策略却必须面对动作、接触、相机视角和物体状态变化。高质量机器人演示的采集成本高,且数据往往和某个机械臂、夹爪或传感器配置紧密耦合。只把多套机器人数据拼在一起,未必能形成稳定的 scaling 曲线。

XR-1 选用了 UMI 轨迹作为预训练入口。UMI 记录的是人通过手持采集装置完成的真实操作,因此保留了手—物体交互、相机运动、场景变化和连续控制轨迹,却不要求先固定到某一种机器人形态。作者称预训练数据覆盖超过 1,700 个场景,包括家庭、商业场所、工业场地和户外环境。

这并不意味着 UMI 数据天然就能训练 VLA。原始长视频缺少与动作片段精确对应的语言条件;而“把杯子放到桌上”这类任务名又过于粗糙,无法说明片段中发生了哪种状态变化。为此,团队让 VLM 对切分后的片段标注夹爪与交互物体的变化,例如抓取、移动、放置或打开,构造“视觉状态—语言状态转变—动作”配对。


图 1:官方项目页展示的预训练数据概览。UMI 轨迹覆盖不同场景和任务,长视频先切成片段,再以语言标注物体与夹爪的状态变化。

这种标注选择有一个重要取舍:状态转变比主观任务名称更贴近一段动作的局部因果结果,因此适合大规模自动生成;但它也可能丢失长程目标、失败恢复和人类偏好。XR-1 的预训练首先学习的是把场景推向某种可描述变化的动作生成能力,不是直接获得所有口语指令的执行能力。

后训练数据则转向真实机器人可执行的监督信号:内部机器人演示、筛选后的开源机器人数据,以及带人工指令标注的 UMI 轨迹共同覆盖移动操作与双臂机器人。这种数据组织为后续的本体与指令对齐提供了接口。


图 2:后训练数据混合了内部机器人、开源机器人与带指令标注的 UMI 轨迹,并覆盖移动操作与双臂机器人。

3. 两阶段训练:先获得通用动作生成,再对齐真实机器人与指令

3.1 预训练:用状态转变把大规模真实轨迹变成条件动作学习

预训练阶段的条件是视觉观察和自动生成的状态转变描述,目标是学习产生能促成该变化的动作。论文将这一步定位为“广度”:场景、物体、交互方式和操作过程尽量多样,动作生成能力也就不必从少量特定机器人任务开始。

官方页面显示,随着预训练数据比例提高、模型规模增大,验证集的 action error 都稳定下降。这种曲线只证明模型对其预训练分布的动作预测更好,却是后面真实机器人迁移结论必要的第一环。


图 3:预训练阶段的 scaling 结果。官方报告称,数据规模和模型尺寸增加时,验证动作误差持续降低。

这里的关键不是把 UMI 当作“机器人数据的廉价替代品”,而是借它建立一个足够大的、与本体弱耦合的动作先验。模型会见到更多物体、抓取方式和操作过程;真正的机器人控制约束则留给下一阶段校正。

3.2 后训练:两条对齐轴把通用先验落到机器人上

后训练包含两条轴。本体对齐(embodiment alignment)使用跨本体的高质量真实机器人数据,将预训练学到的通用动作生成能力映射到实际机器人;指令对齐(instruction alignment)则将条件从“描述已经发生或将发生的状态转变”,改成用户会自然说出的命令。

官方披露的后训练数据由三部分组成:内部真实机器人数据、筛选后的开源机器人数据、带人工时间片段和指令标注的高质量 UMI 数据。内部数据超过 7,200 小时,来自真实家庭环境,覆盖整理沙发、整理鞋柜、收纳厨房用品等任务。图中的移动操作平台与双臂平台也说明,作者希望这一步吸收多种实际本体,而非只服务一台机械臂。

后训练并没有抹掉预训练的 scaling 效应。官方在陌生环境、陌生物体实例上的真实机器人测试中,分别增大预训练数据比例和模型尺寸,成功率整体上升。换言之,预训练动作误差更低的模型,经由相同方向的后训练后,也更容易在真实机器人上成功。


图 4:后训练后的真实机器人测试。左图扩大预训练数据比例,右图增大预训练模型尺寸;两种设置下,多项移动操作任务的成功率总体提高。

猫先生认为,两阶段分工比“直接拿海量视频训练机器人”更务实:预训练解决动作与状态变化的广度,后训练解决本体运动学、执行器误差和人类命令的可用性。它的风险也集中在接口处——若状态转变标注与真实指令分布差异过大,后训练仍可能成为决定泛化上限的瓶颈。

3.3 论文没有公开的部分,不能用想象补齐

截至 2026 年 7 月 21 日,GitHub 仓库仍标记为代码与权重“即将发布”。官方页面没有完整披露视觉—语言骨干、动作表征方式、损失函数、训练 token/step、各数据源配比、自动标注模型及过滤规则。因此,XR-1 的方法贡献可以稳妥概括为数据与训练范式,不宜把它描述成已经完整可复现的模型架构

4. 实验:规模增益是否能转成真实能力与快速适配

4.1 陌生环境中的 out-of-the-box 真实机器人表现

后训练 scaling 图验证的是一个比预训练误差更难的问题:模型没有为测试环境单独收集数据时,增大预训练是否还会提升真实成功率。图 4 的数据比例组和 2B、5B、10B 模型组都指向同一趋势;但曲线并非每个任务、每个规模都严格单调。例如官方图中“沙发整理”在 5B 时高于 10B,说明具体任务仍会受数据组成、随机性和评测样本量影响。应把它理解为总体 scaling 信号,而不是每一个点都服从平滑定律。

4.2 新任务适配:少量演示是否足以改变技能边界

在手机装箱、打印机补料、洗衣装载和箱体打包四个复杂真实任务上,官方项目页给出的平均结果为:每个任务不足 10 小时演示时,XR-1 成功率为75%,对比 π0.5 的40%;预算提高到每任务不足 40 小时时,XR-1 为85%,π0.5 为53%。其中“箱体打包”在较高数据预算下两者都达到 100%,这提示模型差异主要出现在其他更难、或者演示更不足的任务上。

这组实验测量的不是零样本通用性,而是基础策略吸收新技能的样本效率。它支持“大规模预训练提供更好初始化”的判断;但项目页没有给出每项任务的演示分布、失败类型、随机种子或训练成本,因而无法仅靠百分比判断差异来自视觉泛化、动作控制,还是后训练工程细节。

4.3 仿真基准:强结果与版本数字需要分开阅读

arXiv 摘要报告 XR-1 在 RoboCasa365 上达到57.6%,高于此前的 46.6%;RoboDojo 平均分为20.07,高于 13.07。官方项目页当前表格则列出 RoboCasa36557.4%、RoboDojo13.93%,并给出 RoboCasa 74.5%、VLABench 59.1%。同一官方工作在两个公开入口的数值不完全一致,可能来自评测版本、统计口径或页面更新;在代码与完整评测配置发布前,引用时应明确采用哪一份来源,而不应把它们混成同一张排行榜。

猫先生认为,这篇工作提供了很强的规模化信号,但评测可复现性仍是它必须补上的一环。特别是超大规模 UMI 数据、自动标注和跨本体后训练彼此耦合,公开权重与配置后才能分辨增益究竟主要来自数据、模型大小,还是数据清洗与对齐配方。

总结:把“规模”落在可迁移的动作经验上

XR-1 的价值可以收在三点。

  1. 数据入口换了位置。通过 100K+ 小时弱本体绑定的 UMI 真实轨迹,VLA 预训练不必先受限于某一种机器人硬件的数据量。
  2. 训练目标分两步对齐。预训练用状态转变语言连接视觉与动作,后训练再分别处理本体与人类自然指令,这让广度和可执行性不必在一个阶段里硬凑。
  3. 规模证据跨过了预训练验证集。论文不仅展示 action error 的下降,还把数据和模型规模的增益带到陌生场景中的真实机器人,以及后续任务适配与仿真基准。

如果后续发布能补全模型结构、动作空间、数据过滤、自动标注质量控制与统一评测配置,XR-1 将成为检验“真实世界操作轨迹是否也能形成可靠 scaling law”的重要开放基线。眼下更稳妥的结论是:它展示了大规模真实操作数据可以成为 VLA 基础策略的有效预训练原料,而不是已经解决了跨本体通用机器人的全部问题。

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/21 18:48:10

AI4R隐藏马尔可夫模型:用Ruby破解序列预测难题

AI4R隐藏马尔可夫模型:用Ruby破解序列预测难题 【免费下载链接】ai4r Artificial Intelligence for Ruby - A Ruby playground for AI researchers 项目地址: https://gitcode.com/gh_mirrors/ai/ai4r 想要在Ruby中实现序列预测和模式识别吗?AI4R…

作者头像 李华
网站建设 2026/7/21 18:48:07

告别复杂软件:noteDigger如何用纯前端技术重新定义音乐扒谱体验

告别复杂软件:noteDigger如何用纯前端技术重新定义音乐扒谱体验 【免费下载链接】noteDigger 在线前端频谱分析扒谱 front-end music transcription 项目地址: https://gitcode.com/gh_mirrors/no/noteDigger 在音乐创作和学习的道路上,扒谱一直是…

作者头像 李华
网站建设 2026/7/21 18:45:53

人生的九重觉悟

人机协作,仅供参考人生如长河奔涌,总在某个漩涡或险滩处,猝然照见事物的本来面目。那些看似偶然的瞬间,实则是岁月埋下的伏笔,是心智在量变后必然的质变。以下九种时刻,恰似九面镜子,映照出我们…

作者头像 李华
网站建设 2026/7/21 18:45:37

GO_并发编程---select

一、select 基础介绍1. select 与 switch 区别switch:匹配相等条件,可写任意表达式;select:每个 case 只能是 channel IO 操作(读通道 / 写通道),专门用于同时监听多个通道读写状态。2. select …

作者头像 李华
网站建设 2026/7/21 18:45:16

Autotest服务器配置指南:搭建多机器分布式测试环境

Autotest服务器配置指南:搭建多机器分布式测试环境 【免费下载链接】autotest Autotest - Fully automated tests on Linux 项目地址: https://gitcode.com/gh_mirrors/au/autotest Autotest是一款功能强大的Linux自动化测试框架,能够帮助开发人员…

作者头像 李华