news 2026/10/2 20:58:55

【RSS 2025】YOTO:一次人类视频示教的双臂机器人操作|从机器人数据引擎视角

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【RSS 2025】YOTO:一次人类视频示教的双臂机器人操作|从机器人数据引擎视角

摘要

本文解读 RSS 2025 论文《You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations》。该论文提出YOTO,一个只需一次人类双手视频示教就能学会双臂长程操作的框架,通过融合稀疏关键位姿抽象、运动掩码与点云级几何变换增殖,把一段抖动、不连续的人类手部轨迹转换成可编辑、可倍增的机器人动作,其特别之处在于既不需要遥操作硬件,也不需要动捕手套。实验表明五个真实长程任务的五任务平均成功率达到 76.8%,是次优基线 EquiBot(23.4%)的 3.3 倍,分布外摆位下仍有 35.0% 的平均成功率、而三个纯模仿学习基线直接归零,为数据成本高企的双臂模仿学习提供了一条从"人教一次"出发的新路径。

视频讲解:点击观看 B 站视频

  • 摘要
  • 论文基本信息
  • 背景与动机:为什么双臂操作的数据这么贵
  • 研究主线:从问题到结论
  • 基准/方法设计:把"教一次"拆成三段
  • 分类全景:双臂示教数据的三条来源
  • 方法细节:关键位姿、增殖与 BiDP
    • 关键位姿:把抖动轨迹压成十几个点
    • 增殖:一条路径保可达,另一条保多样性
    • BiDP:三个改进都围绕同一前提
  • 实验设计与结果
    • 评测协议与硬件
    • 数据采集效率:为什么必须放弃遥操作
    • 主结果:76.8% 对 23.4%
    • 消融:表示设计与数据多样性同等关键
    • 分布外泛化:基线集体归零
    • 手部轨迹质量的验证
    • 任务与物体详解
    • 失败案例
  • 结果对比总结
  • 关键发现
  • 局限性
  • 常见问题(FAQ)
    • YOTO 需要多少次人类示教?
    • 为什么要把连续手部轨迹换成关键位姿?
    • 增殖出来的示范为什么可信?
    • BiDP 和通用的扩散策略有什么不同?
    • 为什么基线在分布外摆位下会归零?
    • 这套框架能迁移到别的机械臂或任务吗?
  • 参考链接

论文基本信息

项目内容
标题(英文)You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations
标题(中文)YOTO:一次人类视频示教的双臂机器人操作
作者Huayi Zhou、Ruixiang Wang、Yunxin Tai、Yueci Deng、Guiliang Liu、Kui Jia
机构The Chinese University of Hong Kong, Shenzhen、Harbin Institute of Technology, Weihai、DexForce
会议RSS 2025
arXiv2501.14208
项目网站hnuzhy.github.io/projects/YOTO

背景与动机:为什么双臂操作的数据这么贵

双臂操作是具身智能里一个长期成立的老问题,它的难点有两个:一是两条手臂的时空协调,二是动作空间维度很高。围绕这两个难点,主流研究分成两条路线。第一条是按预定义的任务分类把双臂任务拆成可枚举的技能,代表性工作如 PerAct2、VoxAct;这条路线的问题是难以均匀覆盖任意任务,同时限制了机械臂的灵活性。第二条是直接用遥操作采集示范,例如 ALOHA 与 ACT、RDT、π0;它需要大量训练数据,采集成本高,而且遥操作轨迹本身是非稳态、去空间化的,对训练鲁棒且可泛化的策略并不友好。

第三条路是用人类手部视频替代遥操作,代表工作是 DexCap 这一流派。它把人体动作当作天然的教学信号,但通常依赖动捕手套或人形本体这类专用硬件,并且把连续轨迹逐步回放给机器人。YOTO 想做的正是把这条路的两个前提都去掉:只要一台普通的第三人称双目相机,而且不逐帧回放手部轨迹。

论文把"数据从哪来"和"动作怎么表示"当成同一件事来处理。关键帧(keyframes)抽象在 PerAct、C2FARM 里已经被用于长程操作建模,YOTO 继承了这一表示,并把它变成可以被脚本编辑、被几何变换倍增的数据单元;策略侧则沿用视觉运动模仿学习的技术栈(ACT 的动作分块、Diffusion Policy 的条件去噪、DP3 的点云观测与 EquiBot 的 SIM(3) 等变策略),并把它们全部换成点云观测后作为公平基线重训。

研究主线:从问题到结论

图 1:YOTO 研究主线(Mermaid 流程图)。

基准/方法设计:把"教一次"拆成三段

YOTO 的整体结构由三个模块串成闭环。第一个模块是手部动作提取与注入:用 WiLoR 估计三维手部网格(MANO 表示),用 Florence-2 做开放词汇检测、SAM2 做分割,取出被操作物体;左手视图常开用于手部特征提取,右视图只在需要精确深度时唤醒,这样立体匹配的算力至少减半。第二个模块是单次示教的示范增殖:既在真机上自动重放验证,也在点云层面对物体施加受控的几何变换。第三个模块是双臂扩散策略 BiDP的训练与部署。

三个模块共享同一个中间表示:离散的关键位姿加上描述两臂协调的运动掩码。它既是机器人可以直接执行的动作,也是可以被编辑、被倍增的数据单元——这一点是全文的关键。硬件上是两台 Aubo i5 对置放置,配 DH-Robotics 的 PGI 平行夹爪(最大开合 80 mm)与 DexSense 双目工业相机。

图 2:YOTO 面向多种复杂长程双臂任务。只需单次第三人称双目相机观测,即可提取细粒度人类手部运动轨迹,用于双臂协调动作注入与训练示范的快速增殖。上排为严格异步任务(拉抽屉并放置、倒水、拧瓶盖),下排为非抓取式的同步任务(揭盖、拆快递箱)。

分类全景:双臂示教数据的三条来源

图 3:双臂示教数据的三条来源(Mermaid 图)。

方法细节:关键位姿、增殖与 BiDP

关键位姿:把抖动轨迹压成十几个点

三维手部位姿不是直接照搬网格的位姿轨迹,而是用手腕、食指指尖与无名指指尖三个点构造旋转矩阵,这样比直接使用单目网格回归的朝向更稳定。夹爪开合状态用是否与物体接触来判定,比只看手指弯曲更可信。随后在夹爪状态跳变、或者速度与加速度的局部极值处自动切分关键帧,再用逆运动学插值把关键位姿连成可执行轨迹。这里还有一个容易被忽略的设计:运动掩码记录每条手臂在每个关键帧上是保持还是移动,严格异步任务据此删掉那些纯粹"等待"的关键位姿,删掉的个数是 $K = |\widetilde{\mathbf{A}}| / 2$。

图 4:YOTO 总览,三个模块串成闭环。(a) 人类手部动作提取与注入;(b) 由单次示教出发的训练示范增殖;(c) 定制双臂扩散策略 BiDP 的训练与部署。

图 5:提取出的运动轨迹与对应关键帧示例(左手与右手)。紫色为左臂关键位姿,青色为右臂关键位姿,编号顺次为子步顺序,两端为初始机器人状态。

增殖:一条路径保可达,另一条保多样性

增殖有两条路径。第一条是真机自动重放:按运动掩码把关键位姿拆成左臂和右臂两组轨迹,只改动与物体相关的那些关键位姿,例如沿 X 轴平移 5 cm,就能让真机重放同类动作并完成验证。论文给出的规模证据是,一个示教良好的任务大约 8 小时可以采集 300 条示范,速度远快于遥操作,而且示范本身是稳态的。第二条路径在点云层面:对被分割出来的物体点云施加受控的旋转与平移,同步更新对应关键位姿的 6-DoF 数值,得到成对的观测与动作标签,单次只需 1.5 秒。

两条路径互补:真机重放保证动作可达、可执行,几何变换保证视觉观测在位置与物体类别上的多样性;而后者是把数据规模推到数百倍量级的唯一可行方式。

BiDP:三个改进都围绕同一前提

BiDP 相对通用扩散策略做了三处修改。第一,观测从整场景点云缩到被操作的物体点云,只保留 $1024$ 个点,收敛更快也更能抗干扰。第二,预测目标是关键位姿而不是连续动作序列,直接把扩散空间的维度降下来。第三,动作空间按运动掩码重新组织为左右臂两组,异步任务不再学习冗余的等待动作,同步任务则保留双臂同时驱动。网络方面使用四层、隐维 $128$ 的 SIM(3) 等变 PointNet++ 编码器,推理时用 DDIM 八步去噪替代最多一百步的 DDPM。

附录给出的实现配置是:每条手臂的观测为 13 维本体感知(末端三维位置、旋转矩阵的两列、重力方向、夹爪开度),动作为 7 维(位置增量、轴角角速度、夹爪动作);观测视野设为 1,只用左臂初始状态,右臂初始状态在每个任务内固定;预测长度在严格异步任务取关键帧数 $K$、在同步任务取 $2K$;点云采样 $1024$ 点对全部任务都足够,增加到 $2048$ 点以上提升极小却显著增加存储与训练时间;全部策略都可以在单张 RTX 3090 Ti(24 GB)上训练。

实验设计与结果

评测协议与硬件

实验在五个真实双臂任务上做,覆盖严格异步与双臂同步两类协作方式,物体涵盖刚性、铰接、可变形与非抓取式四类。评测时每个物体做 2 到 5 次试验:后三个任务共 30、25、20 次,前两个任务的成对物体共 54、36 次,物体的初始摆位随机。指标沿用 CALVIN 的做法,报告每个子步骤的平均完成长度(Avg. Len.),最后一个子步骤即成功率。四个基线 ACT、Diffusion Policy、DP3 与 EquiBot 全部统一改为点云观测后重新训练,模型保留最后一个 checkpoint 评测。

任务关键帧子步骤平均时长 (s)增殖示范数
pull drawer(异步)10642243
pour water(异步)11653162
unscrew bottle(异步)1255154
uncover lid(同步)1232745
open box(同步)1643536

上表的示范数是几何变换扩增后的统计。需要说明的是关键帧的确定方式:前三个异步任务可以很好地自动抽取,后两个同步任务剩余关键帧过少,因此在跨步较大的关键帧之间人工加密采样,以保证动作平滑。

图 6:五个任务收集的被操作物体,全部来自日常生活、未做定制。上排为倒水与拉抽屉任务的物体,下排依次为拧瓶盖、揭盖与拆箱任务。

数据采集效率:为什么必须放弃遥操作

采集方式操作员drawer (s)pour (s)unscrew (s)
Master-Slave2204.8226.2247.9
Drag & Drop2100.7115.4123.6
Auto-Rollout141.552.151.4
Geo-Trans11.51.51.0

自动重放用 1 名操作员就把单次采集时间压掉约 80%,用于产出实机可验证的示范;几何变换把采集从"物理操作"变成"纯计算",单次 1 到 1.5 秒,是 500 倍量级扩增的唯一可行路径。代价也要说清楚:这些示范的物理合理性由点云与关键位姿之间的对应关系保证,而不是由真机验证保证。

主结果:76.8% 对 23.4%

方法平均成功率↑Avg. Len.(drawer)↑Avg. Len.(lid)↑
ACT5.7%2.131.28
DP15.8%2.061.72
DP319.4%2.801.96
EquiBot23.4%3.541.96
BiDP(本文)76.8%5.312.76

在拉抽屉这个六子步任务上,平均完成长度从 EquiBot 的 3.54 提升到 5.31,最后一个子步骤的成功率是 54 次里成功 43 次,即 79.6%。

图 7:五个双臂任务在真机上的执行可视化,用不同颜色区分左臂、右臂与双臂动作帧,箭头标注运动趋势。

消融:表示设计与数据多样性同等关键

配置启用的策略成功率 / 平均长度
id-1全部关闭(≈ 原始 EquiBot)24.1% / 3.54
id-2纯物体观测48.1% / 3.80
id-3稀疏关键帧51.9% / 4.15
id-4纯物体观测 + 稀疏关键帧57.4% / 4.31
id-5上述 + 重排动作空间61.1% / 4.48
id-6纯物体观测 + 稀疏关键帧 + 几何变换77.8% / 5.15
id-7四项全开79.6% / 5.31

单项打开的收益都接近翻倍,两项叠加到 57.4%,而最大的跃迁来自几何变换增殖:61.1% 直接跳到 77.8%。这说明表示设计与数据多样性缺一不可。

图 8:几何变换扩增倍率的影响(243 条示范作为未扩增基线)。成功率从 61.1% 升到约 79.6%,平均长度从 4.48 升到约 5.3,×100 之后趋于饱和。

分布外泛化:基线集体归零

方法Avg.Len (drawer, 144)Avg.Len (lid, 36)成功率↑
ACT0.250.600.0%
DP0.750.750.0%
DP30.880.850.0%
EquiBot2.251.258.8%
BiDP(本文)4.251.7035.0%

分布外评测换成全新的物体摆位:拉抽屉 144 次试验、揭盖 36 次。ACT、Diffusion Policy、DP3 的平均成功率全部归零,长程任务的级联误差被分布偏移放大;EquiBot 保留 8.8%,因为它对整场景点云做 SIM(3) 等变增广仍然起作用,但本文是显式改变物体几何,训练分布更贴近真实的摆位变化。纯物体点云输入也让模型对场景冗余不那么敏感。

手部轨迹质量的验证

论文的第一个研究问题是"提取出的手部动作质量如何"。如果直接把 HaMeR 或 WiLoR 的三维手部网格中心点拿来用,轨迹在相机空间里既不连续也不一致,几乎无法解析;把这些中心点投影回图像平面,位置序列是平滑可信的,说明误差主要来自深度与尺度而不是检测本身;提升回三维并按关键帧压缩之后,才得到连续一致、可以直接注入机器人的动作。结论是视觉误差靠简化与实机验证来吸收,而不是靠更换更强的网格重建模型。

图 9:提取的手部运动轨迹对比。(a) 原始 3D 手部中心点;(b) 投影到 2D 图像的轨迹;(c) 提升为简化关键帧后的 3D 点。上排为 pull drawer,下排为 uncover lid。

任务与物体详解

图 10:五个长程双臂任务提取出的手部轨迹可视化,可以看到每条轨迹中哪只手臂接触了哪个物体、以及动作的先后顺序。

图 11:被操作物体的厘米级尺寸信息(第一部分)。物体被抽象为长方体(长宽高)与圆柱(高与直径)两类典型几何。

计数的细节是:拉抽屉任务包含 9 件日常物件与 3 个抽屉,倒水包含 6 个瓶子与 3 个杯子,拧瓶盖包含 6 个瓶盖,揭盖包含 5 个带盖盒,拆箱包含 4 个快递箱;前两个任务每个被操作物体设 3 个位置变体,其余任务设 9 个。

图 12:用视觉基础模型(Florence-2 开放词汇检测 + SAM2 分割)自动提取被操作物体。推理时先得到物体掩码,再过滤出对应点云作为策略输入。

失败案例

图 13:五个任务的代表性失败案例,出错区域被框选并放大,便于快速定位失效原因。

失败集中在接触几何的细粒度对齐上,而不是任务级规划:物体在抽屉里放歪导致抽屉关不上、搬运途中物体碰到抽屉把抽屉推移出位、取物时抓偏导致物体没被抓起来、倒水时瓶口与杯口没对齐导致洒水、抓杯柄时接触点偏置导致移动中洒水。这与视觉提取误差和夹爪能力这两条限制是一致的。

结果对比总结

图 14:结果对比总结(Mermaid 图)。

关键发现

  • 五任务平均成功率76.8%,次优基线 EquiBot 为23.4%,差距 3.3 倍;拉抽屉任务的末子步成功率为43/54 = 79.6%。
  • 消融显示单个策略就能把结果从24.1%提到48.1%(纯物体观测)或51.9%(稀疏关键帧),而几何变换增殖带来最大跃迁:61.1% → 77.8%。
  • 数据采集成本差距悬殊:主从遥操作单次204.8 秒、自动重放41.5 秒、点云几何变换仅1.5 秒;一个示教良好的任务约8 小时可采集300 条示范。
  • 分布外摆位下 BiDP 仍有35.0%平均成功率,是 EquiBot(8.8%)的四倍,而 ACT、DP、DP3 全部为0.0%。
  • 关键位姿让动作可编辑:严格异步任务按运动掩码删掉K = |Ã| / 2个等待位姿,动作空间重排把成功率从57.4%提到61.1%。
  • 表示层面的收益是稳定的:五个任务的训练示范数分别是243、162、54、45、36条,全部从一次示教增殖而来。

局限性

  • 视觉提取仍有误差:作者明确承认必须逐一在真机上核验提取出的位置与姿态是否可靠,仍需额外人力。
  • 固定工作台:初版 YOTO 使用两台固定机械臂,可达空间受限,灵活性与可及性不足;未来考虑引入移动底盘。
  • 末端执行器能力有限:所用平行夹爪不够灵活、功能受限,这也是揭盖与拆箱这类任务只能采用非抓取式动作的原因。
  • 几何变换示范缺乏真机验证:扩增示范的物理合理性依赖点云与关键位姿的对应关系,而非实机执行确认。
  • 规模收益存在上限:扩增倍率在 ×100 之后曲线趋于饱和,继续堆数据不会带来线性提升。

常见问题(FAQ)

YOTO 需要多少次人类示教?

一次。整篇论文的出发点就是"教一次":只用一个第三人称双目相机拍摄一遍人类双手示范,从中提取关键位姿,再靠自动重放与点云几何变换把这一次示教增殖成数百条训练示范。

为什么要把连续手部轨迹换成关键位姿?

因为逐帧的手部轨迹不可信。WiLoR、HaMeR 这类三维手部网格重建在相机空间里既不稳定也不连续,而关键位姿对误差不敏感:论文的第一个研究问题验证了原始三维中心点难以解析、二维投影平滑、提升并离散化之后才连续一致。

增殖出来的示范为什么可信?

两条路径各自保证一半。真机自动重放让动作在真实机器人上被验证,保证可达与可执行;点云级几何变换保证视觉观测在位置和物体类别上的多样性。代价是几何变换的示范没有经过真机确认,其合理性由点云与关键位姿的对应关系保证。

BiDP 和通用的扩散策略有什么不同?

三点:观测从整场景点云缩到被操作物体点云(1024 点),预测目标是稀疏关键位姿而不是连续动作序列,动作空间按运动掩码重排以去掉异步任务里冗余的等待动作。网络用 SIM(3) 等变 PointNet++,推理用 DDIM 八步去噪。

为什么基线在分布外摆位下会归零?

因为长程任务的误差会级联。ACT、DP、DP3 在前几个子步骤就开始失败,走到最后一步时已经无法完成,因此平均成功率为 0.0%。EquiBot 依靠对整场景点云的 SIM(3) 等变增广保留了 8.8%,而 YOTO 通过显式改变物体几何让训练分布覆盖了摆位变化,因此还有 35.0%。

这套框架能迁移到别的机械臂或任务吗?

论文的角度是框架与硬件解耦:观测只需要一台双目相机,动作以关键位姿与运动掩码表示,策略只依赖物体点云。作者在五个长程任务之外还演示了两个新任务(重定向笔、翻转编织篮)的一次示教动作注入,但初版仍使用固定工作台与平行夹爪,迁移到移动底盘与灵巧手是作者列出的未来方向。

参考链接

  • 论文 arXiv 摘要页:arXiv:2501.14208
  • 项目主页(含视频、数据集与代码入口):hnuzhy.github.io/projects/YOTO
  • 代码与数据集仓库:github.com/hnuzhy/YOTO
  • 数据集与预训练模型:huggingface.co/HoyerChou/YOTO
  • 基线 ACT / ALOHA:Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(RSS 2023):arXiv:2304.13705
  • 基线 EquiBot:SIM(3)-Equivariant Diffusion Policy(CoRL 2024):arXiv:2407.01479
  • 延伸期刊版本 YOTO++(TPAMI 2026):hnuzhy.github.io/projects/YOTOPlus

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群:白拾的小屋 (750365700)

⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页:YhbCode000(工程文件)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/2 20:57:50

每天的课后练习怎么安排?用练题簿在线刷题,把小任务发给班级

老师布置课后练习,最难的往往不是出一道题,而是让题目、完成时间和反馈都清楚。发在聊天记录里的文件很容易被新消息顶走,学生也不一定知道今天该先练哪一部分。 练题簿微小程序适合把章节题目整理成可学习的题库,再按班级节奏发布…

作者头像 李华
网站建设 2026/10/2 20:56:33

钢粤钢铁:佛山场馆建设用材优质供应商,排名前五实力之选

钢粤钢铁(广东)有限公司是扎根佛山乐从钢铁市场的综合钢铁服务提供商,在钢铁生产、加工与销售领域深耕多年,业务辐射建筑、工程、机械制造、钢结构、市政基建等多个行业,致力于为广大客户提供规格齐全、品质稳定的钢铁原材料与一站式供货服务…

作者头像 李华
网站建设 2026/10/2 20:55:54

2026 心理测评工具筛选要点,员工心理风险筛查怎么做

一、心理风险筛查正从可选项变成合规动作2026年,企业员工心理风险筛查需求已占整体测评市场的36.5%,成为第一大应用场景。国家卫健委等25个部门联合发文,明确要求定期开展心理健康测评、构建监测预警体系;ISO45001也将“定期开展员…

作者头像 李华
网站建设 2026/10/2 20:55:35

Spark Streaming 资源动态分配:提升流处理效率的弹性配置策略

Spark Streaming 资源动态分配:提升流处理效率的弹性配置策略随着大数据处理需求的不断增长,Spark Streaming 资源动态分配成为优化集群资源利用率与处理效率的关键。本文将深入探讨 Executor 弹性配置、批处理间隔调优与资源平衡策略,帮助开…

作者头像 李华