一、机器人数据,正在「摆脱」机器人
2026年,具身智能行业关键目标是“百万小时数据”。1月鹿明机器人预计年内建成超100万小时UMI数据采集产能;5月灵初智能年底达100万小时;北京人形机器人创新中心迈向“全球首个百万小时高质量数据”目标;6月星海图联合北京亦庄启动计划,当年完成百万小时,未来三年走向千万小时。ChatGPT让scaling law成AI核心经验,如今机器人也有望从海量数据中学习。一位负责人称“100万小时”参考GPT3时期语料规模,此尺度下具身智能或对标GPT3/GPT3.5。要让机器人学会叠衣服,可通过遥操作设备控制机械臂采集真机数据,但真机数据获取难、成本高、与硬件相关性强。2023年Open X - Embodiment项目汇集不同实验室数据,提升模型迁移和泛化能力。2024年出现UMI采集办法,效率高、成本低,但需专用夹爪设备。2024年10月EgoMimic把采集工具简化成眼镜,采集门槛低,但离实际控制链路远。2024年10月发布的π0将不同来源数据放入基础模型框架,2025年2月开放代码和模型权重。
二、10亿级数据预算,能换回什么?
100万小时数据,若全用带标注真机数据成本达10亿元,全用UMI全流程数据约4亿 - 6.5亿元,全用Ego数据只需3亿元。模型训练通常用多种数据,Ego和UMI数据低成本覆盖多场景,真机数据接近最终控制。2026年7月发布的Xiaomi - Robotics - 1分预训练和后训练阶段,预训练用10万小时UMI轨迹,后训练用7200多小时真机数据等。小米评测显示预训练数据规模增加可提升新任务学习效率。Physical Intelligence的π0.5采用不同数据组合训练,结果表明不同数据作用不同。因此,10亿元买数据需考虑数据构成、比例和训练阶段。
三、Scaling已验证有效,为什么100万小时还不是临界点?
2026年WAIC论坛上姚卯青定义具身机器人“ChatGPT时刻”为能“开箱即用”。EgoScale、Genesis等研究表明扩大数据规模通常能降低模型损失、改善真机表现。但目前无足够证据表明100万小时是能力跃迁临界点,因为机器人数据“小时”非标准化单位,现有实验规模不足,且持续上升曲线不能证明整数节点有新能力。提前采集的100万小时是静态数据,机器人进入真实环境还需处理意外情况。具身行业大咖认为机器人要进化需数据回流。100万小时是工业化里程碑,但能否带来“ChatGPT时刻”尚无定论。