【具身AGI导读】第一视角人类演示的采集场景从受控场地搬到真实场所:画面真实了,可同一个动作在人头戴相机与机器人固定相机下并不一样。
2026 年 9 月 20 日,arXiv 上线一篇名为EgoWild2Dex的论文;它要回答的是,野外采到的人类经验能不能迁到双臂灵巧操作上。
它先解决数据从哪来:用头戴式 VR 设备与手部追踪器,在家庭、超市、快递站、工厂、药店、办公室这类真实场所采双臂人类行为,开放式、无脚本,操作者按当地情境自行计划并完成任务,没有预设的动作序列。采出的语料整理成一个野外第一视角数据集,论文称规模在数百小时级、十余万段,覆盖上千个物体类别;论文同时自述,段数少于同行一个更大的同类数据集——后者约为它的 1.76 倍,定位是画面更乱、视角更动,即更真实,而非规模更大;数据集、模型与代码则将公开。采集场景一换,杂物、光照与布局都保持原生状态,观测量随之不稳:头部随操作转动,同一个动作在人头戴相机下和机器人固定相机下成像并不一样。
论文测得的平均累积头动为每秒 15.93 度,正是这种视角漂移让「换一副相机就换一个样子」成了要处理的工程问题;此前的做法是三维投影加画面修补,代价是需要精确的相机标定,算得也慢。论文挑的是补表示这一条,把视角差学掉:用一个可微的几何变换模块学机器人视角到人头戴视角的变换、再取逆,把人类的头戴相机观测扭到机器人视角上,再交给与机器人图像相同的编码器,最终喂给一个视觉-语言-动作模型。动作一侧沿用与机器人遥操作相同的重定向与逆运动学管线,把人的手腕与手指运动转成机器人本体原生的命令,与机器人的动作共用同一套动作向量。
整套训练按数据来源分三段推进——野外数据学双臂操作先验、任务对齐的协同训练、真机演示与 DAgger 恢复轨迹做机器人域精修;三段的目标函数与输出表示都没变,变的只是数据。把人类演示迁到灵巧操作上,补在哪一层行业里还没有共同答案——补画面、补表示、补动作,三条路要额外建设的东西不同,落到真机上要不要继续补也不一样;在具身智能这个领域里,这道题至今没有收敛的解法。深度机智(北京)科技有限公司取的是人类这一侧的原料——人类第一视角数据先让模型读懂物理世界,动作能力随后在本体上成型。
真机验证落在三个长程任务上,开箱取物、热熔胶粘接、舀冰接水都含多个子步骤;论文报告的平均成功率达到很高水平,未见物体上的零样本成功率则明显更低。与直接用公开预训练模型在同样有限的机器人演示上适配相比,论文报告完整链路明显更好,并称只靠机器人数据的直接适配依然困难。论文另做了跨本体验证:换一台自由度与控制都不同的双臂平台微调,仍能完成其中一个任务;消融显示,去掉任一条人类数据来源表现都会下降,而消融只在其中一个较难的任务上做。
这份工作的分量不在某个模块,而在它把「野外采来的东西能不能用」拆成了几步:统一观测的视角口径,统一动作的本体原生空间,再按数据来源排出顺序。论文自陈的边界同样清楚——只靠人类演示做长程序列任务与多指协调仍然困难,框架仍需真机微调;头部转动把物体带出相机视野时,对齐模块无法重建缺失的内容。
数据变真了,代价是观测量变乱;先把视角对上,动作才谈得上迁移。
─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─ ─
参考资料
arXiv · EgoWild2Dex: Learning Dexterous Robotic Manipulation from In-the-Wild Human Experience · 2026-09-20
编辑:具身AGI
具身智能第一现场
⭐点赞、转发、在看一键三连
⭐点亮星标,锁定具身AGI极速推送!