摘要
本文解读 RSS 2025 论文《You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations》。该论文提出YOTO,一个只需一次人类双手视频示教就能学会双臂长程操作的框架,通过融合稀疏关键位姿抽象、运动掩码与点云级几何变换增殖,把一段抖动、不连续的人类手部轨迹转换成可编辑、可倍增的机器人动作,其特别之处在于既不需要遥操作硬件,也不需要动捕手套。实验表明五个真实长程任务的五任务平均成功率达到 76.8%,是次优基线 EquiBot(23.4%)的 3.3 倍,分布外摆位下仍有 35.0% 的平均成功率、而三个纯模仿学习基线直接归零,为数据成本高企的双臂模仿学习提供了一条从"人教一次"出发的新路径。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机:为什么双臂操作的数据这么贵
- 研究主线:从问题到结论
- 基准/方法设计:把"教一次"拆成三段
- 分类全景:双臂示教数据的三条来源
- 方法细节:关键位姿、增殖与 BiDP
- 关键位姿:把抖动轨迹压成十几个点
- 增殖:一条路径保可达,另一条保多样性
- BiDP:三个改进都围绕同一前提
- 实验设计与结果
- 评测协议与硬件
- 数据采集效率:为什么必须放弃遥操作
- 主结果:76.8% 对 23.4%
- 消融:表示设计与数据多样性同等关键
- 分布外泛化:基线集体归零
- 手部轨迹质量的验证
- 任务与物体详解
- 失败案例
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- YOTO 需要多少次人类示教?
- 为什么要把连续手部轨迹换成关键位姿?
- 增殖出来的示范为什么可信?
- BiDP 和通用的扩散策略有什么不同?
- 为什么基线在分布外摆位下会归零?
- 这套框架能迁移到别的机械臂或任务吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | You Only Teach Once: Learn One-Shot Bimanual Robotic Manipulation from Video Demonstrations |
| 标题(中文) | YOTO:一次人类视频示教的双臂机器人操作 |
| 作者 | Huayi Zhou、Ruixiang Wang、Yunxin Tai、Yueci Deng、Guiliang Liu、Kui Jia |
| 机构 | The Chinese University of Hong Kong, Shenzhen、Harbin Institute of Technology, Weihai、DexForce |
| 会议 | RSS 2025 |
| arXiv | 2501.14208 |
| 项目网站 | hnuzhy.github.io/projects/YOTO |
背景与动机:为什么双臂操作的数据这么贵
双臂操作是具身智能里一个长期成立的老问题,它的难点有两个:一是两条手臂的时空协调,二是动作空间维度很高。围绕这两个难点,主流研究分成两条路线。第一条是按预定义的任务分类把双臂任务拆成可枚举的技能,代表性工作如 PerAct2、VoxAct;这条路线的问题是难以均匀覆盖任意任务,同时限制了机械臂的灵活性。第二条是直接用遥操作采集示范,例如 ALOHA 与 ACT、RDT、π0;它需要大量训练数据,采集成本高,而且遥操作轨迹本身是非稳态、去空间化的,对训练鲁棒且可泛化的策略并不友好。
第三条路是用人类手部视频替代遥操作,代表工作是 DexCap 这一流派。它把人体动作当作天然的教学信号,但通常依赖动捕手套或人形本体这类专用硬件,并且把连续轨迹逐步回放给机器人。YOTO 想做的正是把这条路的两个前提都去掉:只要一台普通的第三人称双目相机,而且不逐帧回放手部轨迹。
论文把"数据从哪来"和"动作怎么表示"当成同一件事来处理。关键帧(keyframes)抽象在 PerAct、C2FARM 里已经被用于长程操作建模,YOTO 继承了这一表示,并把它变成可以被脚本编辑、被几何变换倍增的数据单元;策略侧则沿用视觉运动模仿学习的技术栈(ACT 的动作分块、Diffusion Policy 的条件去噪、DP3 的点云观测与 EquiBot 的 SIM(3) 等变策略),并把它们全部换成点云观测后作为公平基线重训。
研究主线:从问题到结论
图 1:YOTO 研究主线(Mermaid 流程图)。
基准/方法设计:把"教一次"拆成三段
YOTO 的整体结构由三个模块串成闭环。第一个模块是手部动作提取与注入:用 WiLoR 估计三维手部网格(MANO 表示),用 Florence-2 做开放词汇检测、SAM2 做分割,取出被操作物体;左手视图常开用于手部特征提取,右视图只在需要精确深度时唤醒,这样立体匹配的算力至少减半。第二个模块是单次示教的示范增殖:既在真机上自动重放验证,也在点云层面对物体施加受控的几何变换。第三个模块是双臂扩散策略 BiDP的训练与部署。
三个模块共享同一个中间表示:离散的关键位姿加上描述两臂协调的运动掩码。它既是机器人可以直接执行的动作,也是可以被编辑、被倍增的数据单元——这一点是全文的关键。硬件上是两台 Aubo i5 对置放置,配 DH-Robotics 的 PGI 平行夹爪(最大开合 80 mm)与 DexSense 双目工业相机。
图 2:YOTO 面向多种复杂长程双臂任务。只需单次第三人称双目相机观测,即可提取细粒度人类手部运动轨迹,用于双臂协调动作注入与训练示范的快速增殖。上排为严格异步任务(拉抽屉并放置、倒水、拧瓶盖),下排为非抓取式的同步任务(揭盖、拆快递箱)。
分类全景:双臂示教数据的三条来源
图 3:双臂示教数据的三条来源(Mermaid 图)。
方法细节:关键位姿、增殖与 BiDP
关键位姿:把抖动轨迹压成十几个点
三维手部位姿不是直接照搬网格的位姿轨迹,而是用手腕、食指指尖与无名指指尖三个点构造旋转矩阵,这样比直接使用单目网格回归的朝向更稳定。夹爪开合状态用是否与物体接触来判定,比只看手指弯曲更可信。随后在夹爪状态跳变、或者速度与加速度的局部极值处自动切分关键帧,再用逆运动学插值把关键位姿连成可执行轨迹。这里还有一个容易被忽略的设计:运动掩码记录每条手臂在每个关键帧上是保持还是移动,严格异步任务据此删掉那些纯粹"等待"的关键位姿,删掉的个数是 $K = |\widetilde{\mathbf{A}}| / 2$。
图 4:YOTO 总览,三个模块串成闭环。(a) 人类手部动作提取与注入;(b) 由单次示教出发的训练示范增殖;(c) 定制双臂扩散策略 BiDP 的训练与部署。
图 5:提取出的运动轨迹与对应关键帧示例(左手与右手)。紫色为左臂关键位姿,青色为右臂关键位姿,编号顺次为子步顺序,两端为初始机器人状态。
增殖:一条路径保可达,另一条保多样性
增殖有两条路径。第一条是真机自动重放:按运动掩码把关键位姿拆成左臂和右臂两组轨迹,只改动与物体相关的那些关键位姿,例如沿 X 轴平移 5 cm,就能让真机重放同类动作并完成验证。论文给出的规模证据是,一个示教良好的任务大约 8 小时可以采集 300 条示范,速度远快于遥操作,而且示范本身是稳态的。第二条路径在点云层面:对被分割出来的物体点云施加受控的旋转与平移,同步更新对应关键位姿的 6-DoF 数值,得到成对的观测与动作标签,单次只需 1.5 秒。
两条路径互补:真机重放保证动作可达、可执行,几何变换保证视觉观测在位置与物体类别上的多样性;而后者是把数据规模推到数百倍量级的唯一可行方式。
BiDP:三个改进都围绕同一前提
BiDP 相对通用扩散策略做了三处修改。第一,观测从整场景点云缩到被操作的物体点云,只保留 $1024$ 个点,收敛更快也更能抗干扰。第二,预测目标是关键位姿而不是连续动作序列,直接把扩散空间的维度降下来。第三,动作空间按运动掩码重新组织为左右臂两组,异步任务不再学习冗余的等待动作,同步任务则保留双臂同时驱动。网络方面使用四层、隐维 $128$ 的 SIM(3) 等变 PointNet++ 编码器,推理时用 DDIM 八步去噪替代最多一百步的 DDPM。
附录给出的实现配置是:每条手臂的观测为 13 维本体感知(末端三维位置、旋转矩阵的两列、重力方向、夹爪开度),动作为 7 维(位置增量、轴角角速度、夹爪动作);观测视野设为 1,只用左臂初始状态,右臂初始状态在每个任务内固定;预测长度在严格异步任务取关键帧数 $K$、在同步任务取 $2K$;点云采样 $1024$ 点对全部任务都足够,增加到 $2048$ 点以上提升极小却显著增加存储与训练时间;全部策略都可以在单张 RTX 3090 Ti(24 GB)上训练。
实验设计与结果
评测协议与硬件
实验在五个真实双臂任务上做,覆盖严格异步与双臂同步两类协作方式,物体涵盖刚性、铰接、可变形与非抓取式四类。评测时每个物体做 2 到 5 次试验:后三个任务共 30、25、20 次,前两个任务的成对物体共 54、36 次,物体的初始摆位随机。指标沿用 CALVIN 的做法,报告每个子步骤的平均完成长度(Avg. Len.),最后一个子步骤即成功率。四个基线 ACT、Diffusion Policy、DP3 与 EquiBot 全部统一改为点云观测后重新训练,模型保留最后一个 checkpoint 评测。
| 任务 | 关键帧 | 子步骤 | 平均时长 (s) | 增殖示范数 |
|---|---|---|---|---|
| pull drawer(异步) | 10 | 6 | 42 | 243 |
| pour water(异步) | 11 | 6 | 53 | 162 |
| unscrew bottle(异步) | 12 | 5 | 51 | 54 |
| uncover lid(同步) | 12 | 3 | 27 | 45 |
| open box(同步) | 16 | 4 | 35 | 36 |
上表的示范数是几何变换扩增后的统计。需要说明的是关键帧的确定方式:前三个异步任务可以很好地自动抽取,后两个同步任务剩余关键帧过少,因此在跨步较大的关键帧之间人工加密采样,以保证动作平滑。
图 6:五个任务收集的被操作物体,全部来自日常生活、未做定制。上排为倒水与拉抽屉任务的物体,下排依次为拧瓶盖、揭盖与拆箱任务。
数据采集效率:为什么必须放弃遥操作
| 采集方式 | 操作员 | drawer (s) | pour (s) | unscrew (s) |
|---|---|---|---|---|
| Master-Slave | 2 | 204.8 | 226.2 | 247.9 |
| Drag & Drop | 2 | 100.7 | 115.4 | 123.6 |
| Auto-Rollout | 1 | 41.5 | 52.1 | 51.4 |
| Geo-Trans | 1 | 1.5 | 1.5 | 1.0 |
自动重放用 1 名操作员就把单次采集时间压掉约 80%,用于产出实机可验证的示范;几何变换把采集从"物理操作"变成"纯计算",单次 1 到 1.5 秒,是 500 倍量级扩增的唯一可行路径。代价也要说清楚:这些示范的物理合理性由点云与关键位姿之间的对应关系保证,而不是由真机验证保证。
主结果:76.8% 对 23.4%
| 方法 | 平均成功率↑ | Avg. Len.(drawer)↑ | Avg. Len.(lid)↑ |
|---|---|---|---|
| ACT | 5.7% | 2.13 | 1.28 |
| DP | 15.8% | 2.06 | 1.72 |
| DP3 | 19.4% | 2.80 | 1.96 |
| EquiBot | 23.4% | 3.54 | 1.96 |
| BiDP(本文) | 76.8% | 5.31 | 2.76 |
在拉抽屉这个六子步任务上,平均完成长度从 EquiBot 的 3.54 提升到 5.31,最后一个子步骤的成功率是 54 次里成功 43 次,即 79.6%。
图 7:五个双臂任务在真机上的执行可视化,用不同颜色区分左臂、右臂与双臂动作帧,箭头标注运动趋势。
消融:表示设计与数据多样性同等关键
| 配置 | 启用的策略 | 成功率 / 平均长度 |
|---|---|---|
| id-1 | 全部关闭(≈ 原始 EquiBot) | 24.1% / 3.54 |
| id-2 | 纯物体观测 | 48.1% / 3.80 |
| id-3 | 稀疏关键帧 | 51.9% / 4.15 |
| id-4 | 纯物体观测 + 稀疏关键帧 | 57.4% / 4.31 |
| id-5 | 上述 + 重排动作空间 | 61.1% / 4.48 |
| id-6 | 纯物体观测 + 稀疏关键帧 + 几何变换 | 77.8% / 5.15 |
| id-7 | 四项全开 | 79.6% / 5.31 |
单项打开的收益都接近翻倍,两项叠加到 57.4%,而最大的跃迁来自几何变换增殖:61.1% 直接跳到 77.8%。这说明表示设计与数据多样性缺一不可。
图 8:几何变换扩增倍率的影响(243 条示范作为未扩增基线)。成功率从 61.1% 升到约 79.6%,平均长度从 4.48 升到约 5.3,×100 之后趋于饱和。
分布外泛化:基线集体归零
| 方法 | Avg.Len (drawer, 144) | Avg.Len (lid, 36) | 成功率↑ |
|---|---|---|---|
| ACT | 0.25 | 0.60 | 0.0% |
| DP | 0.75 | 0.75 | 0.0% |
| DP3 | 0.88 | 0.85 | 0.0% |
| EquiBot | 2.25 | 1.25 | 8.8% |
| BiDP(本文) | 4.25 | 1.70 | 35.0% |
分布外评测换成全新的物体摆位:拉抽屉 144 次试验、揭盖 36 次。ACT、Diffusion Policy、DP3 的平均成功率全部归零,长程任务的级联误差被分布偏移放大;EquiBot 保留 8.8%,因为它对整场景点云做 SIM(3) 等变增广仍然起作用,但本文是显式改变物体几何,训练分布更贴近真实的摆位变化。纯物体点云输入也让模型对场景冗余不那么敏感。
手部轨迹质量的验证
论文的第一个研究问题是"提取出的手部动作质量如何"。如果直接把 HaMeR 或 WiLoR 的三维手部网格中心点拿来用,轨迹在相机空间里既不连续也不一致,几乎无法解析;把这些中心点投影回图像平面,位置序列是平滑可信的,说明误差主要来自深度与尺度而不是检测本身;提升回三维并按关键帧压缩之后,才得到连续一致、可以直接注入机器人的动作。结论是视觉误差靠简化与实机验证来吸收,而不是靠更换更强的网格重建模型。
图 9:提取的手部运动轨迹对比。(a) 原始 3D 手部中心点;(b) 投影到 2D 图像的轨迹;(c) 提升为简化关键帧后的 3D 点。上排为 pull drawer,下排为 uncover lid。
任务与物体详解
图 10:五个长程双臂任务提取出的手部轨迹可视化,可以看到每条轨迹中哪只手臂接触了哪个物体、以及动作的先后顺序。
图 11:被操作物体的厘米级尺寸信息(第一部分)。物体被抽象为长方体(长宽高)与圆柱(高与直径)两类典型几何。
计数的细节是:拉抽屉任务包含 9 件日常物件与 3 个抽屉,倒水包含 6 个瓶子与 3 个杯子,拧瓶盖包含 6 个瓶盖,揭盖包含 5 个带盖盒,拆箱包含 4 个快递箱;前两个任务每个被操作物体设 3 个位置变体,其余任务设 9 个。
图 12:用视觉基础模型(Florence-2 开放词汇检测 + SAM2 分割)自动提取被操作物体。推理时先得到物体掩码,再过滤出对应点云作为策略输入。
失败案例
图 13:五个任务的代表性失败案例,出错区域被框选并放大,便于快速定位失效原因。
失败集中在接触几何的细粒度对齐上,而不是任务级规划:物体在抽屉里放歪导致抽屉关不上、搬运途中物体碰到抽屉把抽屉推移出位、取物时抓偏导致物体没被抓起来、倒水时瓶口与杯口没对齐导致洒水、抓杯柄时接触点偏置导致移动中洒水。这与视觉提取误差和夹爪能力这两条限制是一致的。
结果对比总结
图 14:结果对比总结(Mermaid 图)。
关键发现
- 五任务平均成功率76.8%,次优基线 EquiBot 为23.4%,差距 3.3 倍;拉抽屉任务的末子步成功率为43/54 = 79.6%。
- 消融显示单个策略就能把结果从24.1%提到48.1%(纯物体观测)或51.9%(稀疏关键帧),而几何变换增殖带来最大跃迁:61.1% → 77.8%。
- 数据采集成本差距悬殊:主从遥操作单次204.8 秒、自动重放41.5 秒、点云几何变换仅1.5 秒;一个示教良好的任务约8 小时可采集300 条示范。
- 分布外摆位下 BiDP 仍有35.0%平均成功率,是 EquiBot(8.8%)的四倍,而 ACT、DP、DP3 全部为0.0%。
- 关键位姿让动作可编辑:严格异步任务按运动掩码删掉K = |Ã| / 2个等待位姿,动作空间重排把成功率从57.4%提到61.1%。
- 表示层面的收益是稳定的:五个任务的训练示范数分别是243、162、54、45、36条,全部从一次示教增殖而来。
局限性
- 视觉提取仍有误差:作者明确承认必须逐一在真机上核验提取出的位置与姿态是否可靠,仍需额外人力。
- 固定工作台:初版 YOTO 使用两台固定机械臂,可达空间受限,灵活性与可及性不足;未来考虑引入移动底盘。
- 末端执行器能力有限:所用平行夹爪不够灵活、功能受限,这也是揭盖与拆箱这类任务只能采用非抓取式动作的原因。
- 几何变换示范缺乏真机验证:扩增示范的物理合理性依赖点云与关键位姿的对应关系,而非实机执行确认。
- 规模收益存在上限:扩增倍率在 ×100 之后曲线趋于饱和,继续堆数据不会带来线性提升。
常见问题(FAQ)
YOTO 需要多少次人类示教?
一次。整篇论文的出发点就是"教一次":只用一个第三人称双目相机拍摄一遍人类双手示范,从中提取关键位姿,再靠自动重放与点云几何变换把这一次示教增殖成数百条训练示范。
为什么要把连续手部轨迹换成关键位姿?
因为逐帧的手部轨迹不可信。WiLoR、HaMeR 这类三维手部网格重建在相机空间里既不稳定也不连续,而关键位姿对误差不敏感:论文的第一个研究问题验证了原始三维中心点难以解析、二维投影平滑、提升并离散化之后才连续一致。
增殖出来的示范为什么可信?
两条路径各自保证一半。真机自动重放让动作在真实机器人上被验证,保证可达与可执行;点云级几何变换保证视觉观测在位置和物体类别上的多样性。代价是几何变换的示范没有经过真机确认,其合理性由点云与关键位姿的对应关系保证。
BiDP 和通用的扩散策略有什么不同?
三点:观测从整场景点云缩到被操作物体点云(1024 点),预测目标是稀疏关键位姿而不是连续动作序列,动作空间按运动掩码重排以去掉异步任务里冗余的等待动作。网络用 SIM(3) 等变 PointNet++,推理用 DDIM 八步去噪。
为什么基线在分布外摆位下会归零?
因为长程任务的误差会级联。ACT、DP、DP3 在前几个子步骤就开始失败,走到最后一步时已经无法完成,因此平均成功率为 0.0%。EquiBot 依靠对整场景点云的 SIM(3) 等变增广保留了 8.8%,而 YOTO 通过显式改变物体几何让训练分布覆盖了摆位变化,因此还有 35.0%。
这套框架能迁移到别的机械臂或任务吗?
论文的角度是框架与硬件解耦:观测只需要一台双目相机,动作以关键位姿与运动掩码表示,策略只依赖物体点云。作者在五个长程任务之外还演示了两个新任务(重定向笔、翻转编织篮)的一次示教动作注入,但初版仍使用固定工作台与平行夹爪,迁移到移动底盘与灵巧手是作者列出的未来方向。
参考链接
- 论文 arXiv 摘要页:arXiv:2501.14208
- 项目主页(含视频、数据集与代码入口):hnuzhy.github.io/projects/YOTO
- 代码与数据集仓库:github.com/hnuzhy/YOTO
- 数据集与预训练模型:huggingface.co/HoyerChou/YOTO
- 基线 ACT / ALOHA:Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware(RSS 2023):arXiv:2304.13705
- 基线 EquiBot:SIM(3)-Equivariant Diffusion Policy(CoRL 2024):arXiv:2407.01479
- 延伸期刊版本 YOTO++(TPAMI 2026):hnuzhy.github.io/projects/YOTOPlus
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)