写在最前:从小米my16和宇树科技的WVLA2.0思考,2028具身智能可能会迎来ChatGPT时刻,VLA+世界模型可能会成为主流范式。
目录
一、RT-1的提出背景与模型定位
1.1 RT-1要解决什么问题
1.2 RT-1为什么使用Transformer
1.3 RT-1属于VLA吗
二、RT-1的数据组织与动作表示
2.1 Episode是什么
2.2 Episode如何变成训练样本
2.3 训练标签到底是什么
2.4 RT-1的动作空间
2.5 连续动作如何变成动作Token
2.6 动作Token与语言词表没有关系
三、RT-1的模型结构与视觉语言融合
3.1 整体结构
3.2 语言如何处理:Universal Sentence Encoder
3.3 语言和视觉不是简单拼接
3.4 FiLM如何把语言写入视觉特征
3.5 Identity-Initialized FiLM
3.6 图像如何变成视觉Token
3.7 TokenLearner如何压缩视觉Token
3.8 Transformer如何生成动作
四、RT-1的训练过程
4.1 训练方式:行为克隆
4.2 完整训练数据流
4.3 动作分类损失
4.4 因果掩码与时间信息
4.5 RT-1不是强化学习
五、RT-1的推理与闭环控制
5.1 推理过程
5.2 为什么是闭环控制
5.3 预测动作和实际位移的区别
5.4 控制频率与终止
六、RT-1的数据规模、能力与实验意义
6.1 数据规模
6.2 任务类型
6.3 数据多样性的重要性
6.4 异构数据吸收能力
6.5 泛化与鲁棒性
6.6 与SayCan的配合
七、RT-1的贡献、局限与技术演进
7.1 RT-1的核心贡献
7.2 RT-1的主要局限
7.3 RT-1、RT-2与π₀的演进关系
7.4 整体总结
哲学视角
一、RT-1的提出背景与模型定位
1.1 RT-1要解决什么问题
RT-1全称为Robotics Transformer 1,是Google Robotics与Everyday Robots团队于2022年提出的多任务机器人策略模型。传统机器人学习通常针对单一任务训练单独策略,例如抓取杯子、打开抽屉、移动物体可能分别需要不同模型。RT-1希望验证:能否训练一个统一的Transformer策略,使其同时吸收不同任务、物体、环境以及机器人平台的数据,并随着数据规模和任务多样性的增加获得更强的泛化能力。RT-1可以表示为一个条件策略:
其中,i表示本次任务的语言指令,x≤t表示截至时间t的视觉观察,at表示机器人当前需要执行的动作,πθ表示参数为θ的机器人策略。其核心任务可以概括为:
语言指令+最近一段视觉观察→当前机器人动作。
例如输入指令“打开上方抽屉”,机器人根据最近看到的画面,依次预测靠近把手、调整夹爪、闭合夹爪和向后拉动等动作。
1.2 RT-1为什么使用Transformer
机器人当前应该做什么,不仅取决于当前画面,还取决于过去几帧发生了什么。例如一张静态图像只能显示夹爪位于杯子附近,却无法判断夹爪是在靠近杯子,还是刚刚离开杯子。RT-1使用Transformer处理最近6帧视觉特征,通过自注意力综合分析目标物体、夹爪位置以及短期运动趋势,再预测下一步动作。Transformer在RT-1中的作用不是负责理解原始文字,而是处理已经融入语言条件的多帧视觉Token:
多帧视觉语言Token→Transformer→动作Token
1.3 RT-1属于VLA吗
RT-1同时涉及视觉、语言和动作,但它没有从互联网规模的视觉语言模型VLM出发,也没有把完整语言Token、视觉Token和动作Token统一到同一套生成框架中。语言在RT-1中主要作为视觉编码器的任务条件,因此更准确的定位是:
RT-1=语言条件下的大规模多任务机器人策略模型。
它是后来VLA路线的重要前身,但并不是RT-2之后所定义的完整VLA基础模型。RT-1的主要突破是证明机器人策略也能通过统一模型、大规模数据和多任务训练获得泛化能力。
二、RT-1的数据组织与动作表示
2.1 Episode是什么
从任务开始到任务结束的一次完整机器人交互称为一个Episode,可以表示为:
其中,i表示整条轨迹对应的语言指令,xj表示第j个时间步的观察图像,aj表示机器人看到xj后执行的动作,x0表示初始观察,xT表示执行完最后一个动作后的终止观察。例如语言指令是“打开上方抽屉”,完整过程可以表示为:
机器人先在x0中看到关闭的抽屉,执行靠近把手的动作a0;得到新的画面x1后,再调整夹爪方向;之后完成对齐、闭合夹爪和拉动,最终在xT中看到已经打开的抽屉。
2.2 Episode如何变成训练样本
Episode是一条完整任务轨迹,训练样本则是从轨迹的某个时间点切出来的数据。RT-1在第t个时间步使用语言指令和最近6帧图像预测专家动作:
因此,一条包含大量时间步的Episode可以形成很多训练样本:
模型输入中的6帧图像是用于理解当前状态和运动趋势,不是用来计算“第1帧到第6帧实际移动了多少”。
2.3 训练标签到底是什么
训练标签at是人类遥操作员在时间步t真实下发给机器人的控制指令,而不是通过比较前后图像计算出的视觉位移。数据采集系统会按照时间戳同步记录:
语言指令+相机图像+遥操作控制指令+机器人状态
例如最近6帧显示夹爪逐渐靠近杯子,操作员此时下发的控制指令可能是:
这组指令就是当前样本的监督标签。如果操作员此时没有移动机械臂,对应的部分动作值可以接近0。这类“零动作”不一定是无效数据,因为机器人本身也需要学习保持姿态、停止移动和短暂等待。但如果数据中存在大量无意义停顿,模型可能形成“不确定时倾向于不动”的偏差,所以实际数据处理中通常需要过滤过长的静止片段、控制零动作样本比例,并保留真正有意义的保持动作。
2.4 RT-1的动作空间
RT-1的动作包含11个维度。机械臂动作有7维:x,y,z表示末端执行器的三维平移,roll,pitch,yaw表示三维旋转,gripper表示夹爪开合。
移动底盘动作有3维:
另外还有一个模式变量,分别表示当前控制机械臂、控制移动底盘或者终止当前Episode。
因此可以将完整动作写成:
RT-1输出的是较高层的末端位姿增量、夹爪和底盘控制量,而不是直接输出每个电机的电流。机器人底层控制器仍负责把这些目标转换为关节和电机信号。
2.5 连续动作如何变成动作Token
机器人动作原本是连续值,例如:
RT-1不直接回归连续动作,而是将每个连续动作维度的有效范围均匀划分为256个区间。对于第d个动作维度,设其范围为[ld,ud],可以概念化地量化为:
其中,at(d)表示真实连续动作值,kd表示量化后的动作Token。假设某个动作维度范围为[−1,1],则Token 0接近最大负向动作,Token 128接近0,Token 255接近最大正向动作。RT-1每个控制周期预测的是一组动作Token:
这些动作维度可以并行预测,不需要像语言模型生成句子一样逐个自回归输出。
2.6 动作Token与语言词表没有关系
RT-1中的动作Token只是某个动作维度的量化档位,不属于语言词表:
语言Token 128=词表中的某个文字或子词
动作Token 128=某动作维度的第128个量化区间
即使编号相同,两者也没有任何语义关系。RT-1训练的是独立的动作分类空间,而不是让语言模型词表直接表示动作。模型输出动作Token后,还需要反量化为连续控制量:
三、RT-1的模型结构与视觉语言融合
3.1 整体结构
RT-1的完整模型结构可以概括为:
前置:语言指令→USE语言向量→FiLM调制EfficientNet为FiLM-EfficientNet
后处理:最近6帧图像→经过FiLM-EfficientNet→每帧9×9×512特征图→每帧81个Token→TokenLearner→每帧8个Token→6帧×8=48个Token→Transformer→11维动作Token
其中,语言不作为独立文本Token进入主Transformer,而是在图像特征生成阶段提前融入视觉表示。
3.2 语言如何处理:Universal Sentence Encoder
语言指令先经过Universal Sentence Encoder,简称USE,被编码成一个固定长度的句子语义向量:
例如:
i=“拿起桌面上的红色杯子”
经过USE后得到:
这个向量整体表示“拿起”这一动作意图、“杯子”这一目标对象、“红色”这一属性以及“桌面上”这一空间关系。需要注意,不能理解成某一维单独代表“拿起”,另一维单独代表“杯子”;语义信息分布在整个高维向量中。RT-1的主Transformer不会直接看到“拿起”“红色”“杯子”等原始文本Token,它接收到的是语言向量已经调制过的视觉特征。
3.3 语言和视觉不是简单拼接
常见的多模态方式可能是把视觉向量和语言向量直接拼接:
RT-1没有采用这种后期拼接方式,而是使用FiLM进行早期语言融合。两种方式的直观区别是:
直接拼接:先独立看图+先独立理解语言→最后融合
RT-1:先理解任务→带着任务去看图
因此,RT-1进入Transformer的不是[视觉Token]+[语言Token],而是已经被语言条件化的视觉特征Token.
3.4 FiLM如何把语言写入视觉特征
EfficientNet处理中间图像时会产生视觉特征图:
其中,H,W表示空间尺寸,C表示特征通道数。语言向量经过小型网络后生成两组参数:
FiLM使用这两组参数调节图像特征:
其中,γ用于调整不同视觉特征通道的缩放强度,β用于调整偏移,F′表示融入当前语言任务后的视觉特征。假设同一张画面中同时存在红色杯子、蓝色碗、抽屉和机器人夹爪。当指令为“拿起红色杯子”时,模型会更强调与红色、杯子、夹爪和抓取区域有关的特征;当指令变为“打开抽屉”时,同一张图像会更强调抽屉、把手和夹爪之间的关系。因此:
同一张图像+不同语言指令→不同视觉特征
FiLM不会直接输出“杯子位于哪个像素”,空间位置仍由图像特征图保存。语言的作用是改变模型应该重点提取和保留哪些视觉信息。
3.5 Identity-Initialized FiLM
EfficientNet-B3已经在ImageNet上完成预训练,拥有较好的视觉特征提取能力。如果FiLM参数完全随机初始化,训练开始时可能会破坏EfficientNet已有的视觉表示。因此RT-1让FiLM初始时接近恒等变换:
初始化时:
因此:
训练初期先保留预训练视觉能力,之后再通过机器人数据逐渐学会不同语言指令应该增强或抑制哪些视觉特征。
3.6 图像如何变成视觉Token
RT-1在每个控制时刻使用最近6张分辨率为300×300的RGB图像。每张图像经过FiLM-EfficientNet-B3后,得到:
这表示图像被编码成9×9个空间位置,每个位置对应一个512维特征向量。将空间维度展开:
得到:
其中:
每个fp就是一个视觉特征Token。这里的Token不是离散编号,而是连续浮点向量,例如:
这些Token既包含相应空间位置的视觉信息,也包含FiLM注入的语言任务条件,因此可以称为视觉语言Token。RT-1与ViT的Token化方式不同:
ViT:原始图像Patch→Patch Token
RT-1:原图→CNN特征图→空间特征Token
3.7 TokenLearner如何压缩视觉Token
如果每帧保留81个Token,6帧一共会产生:81×6=486个Token,不利于实时控制。RT-1使用TokenLearner将每帧81个视觉Token压缩为8个。第k个输出Token可以概念化表示为:
其中,fp表示第p个空间位置的特征向量,αk,p表示第k组注意权重对该位置的关注程度,zk表示加权聚合后的Token。TokenLearner不是固定截取8块区域,也不是选择数值最大的8个Token,而是学习8组不同的空间权重,对原来的81个位置进行软聚合。从直觉上看,这些Token可能分别聚合目标物体、夹爪、容器、抽屉把手、障碍物以及相对位置等信息,但这些关注模式不是人工指定的,而是由最终动作预测损失自动学习。每帧压缩成8个Token后,最近6帧总共形成:6×8=48个Token,再加入位置和时间顺序信息送入Transformer。
3.8 Transformer如何生成动作
RT-1使用8层Decoder-only Transformer处理48个视觉语言Token。Transformer通过自注意力综合判断:目标物体在哪里、夹爪当前在哪里、过去几帧如何移动、物体是否已经被抓住、任务是否接近完成以及下一步应该继续靠近、闭合夹爪还是移动底盘。
需要特别强调,主Transformer实际看到的是:
多帧、带语言条件的视觉特征Token
而不是原始图像、文本Token和动作Token的直接拼接。
四、RT-1的训练过程
4.1 训练方式:行为克隆
RT-1主要使用模仿学习中的行为克隆。训练数据来自人类遥操作机器人成功完成任务的示范,模型学习的是:
在当前语言和视觉状态下,专家会执行什么动作
行为克隆目标可以表示为:
其中,D表示训练Episode集合,at expert表示遥操作员在时间步t真实下发的专家动作。
4.2 完整训练数据流
RT-1的训练过程可以概括为:
①数据:成功Episode→沿时间轴切分训练样本
②语言:语言指令→USE→FiLM调制
③视觉语言融合:视觉特征6帧图像→FiLMEfficientNet→TokenLearner
④训练:48个视觉语言Token→Transformer预测动作Token→与专家动作Token计算损失
模型在训练阶段可以看到专家动作标签,推理阶段则没有标签,只能依靠当前图像和语言自主预测。
4.3 动作分类损失
由于每个连续动作维度被量化成离散类别,RT-1可以将训练损失理解为多个动作维度分类交叉熵之和:
其中,pθ(d)表示模型对第d个动作维度的分类概率,kd expert表示专家动作对应的真实量化档位。离散分类的优点是训练相对稳定,但也存在一个问题:交叉熵会把所有错误类别视为相互独立。例如真实Token是128,预测127通常比预测20更接近真实动作,但普通分类损失本身不会充分表达这种物理距离关系。
4.4 因果掩码与时间信息
RT-1使用因果掩码,保证模型预测当前时间步动作时不能看到未来观察和未来动作。训练样本虽然来自完整Episode,但模型只能利用当前及之前的视觉信息:
这样训练过程才能与实际部署保持一致。
4.5 RT-1不是强化学习
Episode可以带有任务是否成功的终止结果,但RT-1的主要参数学习不依赖在线奖励试错。它主要从成功的专家示范中监督学习下一步动作。因此:
RT-1主要训练方式=模仿学习中的行为克隆
而不是:随机探索+环境奖励→在线强化学习
五、RT-1的推理与闭环控制
5.1 推理过程
RT-1部署后按照以下顺序运行:
①用户输入语言指令;
②机器人获取最近6帧相机图像;
③USE把语言指令编码为句子向量;
④FiLM-EfficientNet生成语言条件化的图像特征;
⑤TokenLearner将每帧81个Token压缩为8个;
⑥Transformer预测当前的一组动作Token;
⑦动作Token反量化为连续控制量;
⑧底层控制器驱动机械臂或底盘;
⑨相机获得新的真实画面;
⑩更新6帧视觉窗口并继续预测。
其闭环可以表示为:
5.2 为什么是闭环控制
RT-1不会一次生成完整任务轨迹后从头执行到底,而是每次执行当前控制周期的动作,然后重新观察真实环境:
观察→动作→新观察→新动作
如果夹爪没有按照预期到达目标位置,或者物体发生移动,新画面会在下一次预测中反映这些变化,模型可以继续修正动作。
5.3 预测动作和实际位移的区别
RT-1输出的是动作控制指令,而不是环境一定会发生的实际位移。例如模型输出“向前移动”,但如果机械臂发生碰撞、受到关节限位或底层控制器未能完全执行,真实位移可能小于指令值。下一步模型会根据新的真实图像重新判断,而不是假设上一步动作一定完全执行成功。因此需要区分:
模型动作at=希望机器人执行的控制量
实际状态变化xt→xt+1=机器人和环境共同产生的结果
5.4 控制频率与终止
RT-1以约3Hz频率输出动作,即每秒大约进行3次策略决策。模型持续进行闭环预测,直到输出terminate模式或达到系统设置的最大时间步。3Hz对于抓取、移动和开抽屉等相对低频操作可以工作,但对于快速、灵巧和高频接触操作仍然有限。这也是后续模型开始使用动作块、连续动作专家和更高控制频率的重要原因。
六、RT-1的数据规模、能力与实验意义
6.1 数据规模
RT-1的主要数据集由13台Everyday Robots机器人在17个月内采集,包含超过13万个真实机器人Episode和700多种任务。机器人具备7自由度机械臂、双指夹爪以及移动底盘,数据主要由人类遥操作采集,并为每条Episode配套语言指令。
大规模真实机器人数据收集本身并不只是“保存视频”。数据系统需要同步记录图像、语言、操作员控制指令、机器人状态和时间戳,还需要反复摆放物体、重置环境、处理失败轨迹以及维护机器人设备。记录数据相对容易,真正困难的是稳定、长期、高质量地采集足够多样的数据。
6.2 任务类型
训练任务包括抓取和放置物体、打开或关闭抽屉、从抽屉中取出物体、将物体放入容器、把细长物体竖直放置或推倒、抽取餐巾纸以及打开罐子等。语言指令通常可以拆成“技能+目标对象”,例如:
这种任务组织方式可以测试模型是否能够把已经见过的技能和物体重新组合,完成训练中没有直接出现过的新指令。
6.3 数据多样性的重要性
RT-1的实验说明,机器人数据不仅要多,还要覆盖足够多的任务、物体、背景和场景。即使总样本量保持较高,如果任务种类明显减少,模型的泛化能力仍会下降。这说明机器人数据的价值不能只用Episode数量衡量:还需要关注:任务多样性+物体多样性+环境多样性+机器人多样性
6.4 异构数据吸收能力
RT-1还验证了加入仿真数据和其他机器人平台数据的可能性。这说明统一策略模型可以尝试吸收不同来源的数据,而不是每个机器人平台完全独立训练。不过,不同机器人动作空间和观察方式并不完全一致,异构数据必须经过动作空间对齐、输入格式统一或平台标识处理,才能被同一个策略有效利用。
6.5 泛化与鲁棒性
RT-1能够在数百种训练任务上工作,并对新的技能—物体组合、不同背景和干扰物表现出一定泛化和鲁棒性。例如模型学习过“拿起杯子”和“移动罐子”后,可能对新的“移动杯子”组合产生一定迁移能力。但这种泛化主要建立在已有技能和已有对象概念的重新组合上,并不代表模型能够凭空掌握训练数据中完全没有的世界知识或复杂动作。
6.6 与SayCan的配合
RT-1主要负责低层技能执行,不擅长独立完成复杂长时规划。对于“整理桌面”这种任务,可以由SayCan或其他高层规划系统先拆成:
找到物体→抓取物体→移动到抽屉→放入抽屉
RT-1再逐个执行这些语言子指令。因此可以理解为:
SayCan=决定下一项技能
RT-1=把当前技能转成机器人动作
七、RT-1的贡献、局限与技术演进
7.1 RT-1的核心贡献
第一,RT-1证明了统一机器人策略能够从大规模、多任务真实机器人数据中学习,而不必为每个任务单独训练模型。
第二,它把机器人控制工程化地转化为Token序列建模问题:视觉表示为连续特征Token,语言通过FiLM写入视觉特征,连续动作离散为动作Token,最后由Transformer完成从视觉历史到动作的映射。
第三,RT-1围绕实时控制进行了专门设计,通过TokenLearner减少视觉Token数量,并使用并行动作分类,使模型能够以约3Hz频率运行在真实机器人闭环中。
其核心结构可以概括为:语言条件视觉编码+时序Transformer+离散动作预测
7.2 RT-1的主要局限
第一,RT-1依赖专家示范。行为克隆只能学习数据中存在的动作模式,离开示范分布后容易累积误差。
第二,语言理解能力有限。USE将整条指令压缩为句子向量,语言主要承担任务条件作用,模型没有继承互联网规模VLM中的开放语义和世界知识。
第三,动作离散化存在量化误差,连续控制只能用256个档位近似表示。
第四,RT-1每次主要生成当前控制周期的一组动作,没有像ACT或π₀一样输出未来多个时间步的动作块。
第五,3Hz控制频率和单步动作形式对于快速、灵巧和高频接触任务仍然有限。
第六,RT-1没有显式世界模型,不能直接预测不同候选动作会如何改变未来环境;它主要通过观察当前状态直接做出反应。
第七,复杂长时任务仍然依赖SayCan等外部规划系统。
7.3 RT-1、RT-2与π₀的演进关系
对比项 | RT-1 | RT-2 | π₀ |
|---|---|---|---|
模型定位 | 语言条件多任务机器人策略 | 视觉语言动作VLA | 通用机器人基础策略 |
基础模型 | EfficientNet+小型Transformer | 互联网预训练VLM | 预训练VLM+Action Expert |
语言处理 | USE句子向量 | 完整语言Token | 完整语言Token |
视觉语言融合 | FiLM调制视觉特征 | VLM内部多模态联合建模 | VLM为动作专家提供条件 |
视觉输入 | 最近6帧图像 | 主要使用当前图像 | 多视角图像和机器人状态 |
动作表示 | 11维单步离散动作Token | 映射到VLM词表的动作Token | 连续多步动作块 |
动作生成 | 并行动作分类 | 自回归生成动作Token | Flow Matching生成连续动作 |
主要数据 | 机器人示范 | Web图文数据+机器人示范 | 多机器人预训练+任务后训练 |
主要意义 | 证明机器人策略可以规模化 | 将互联网知识迁移到动作 | 加强高频连续动作建模 |
三者的演进主线可以概括为:
RT-1:大规模机器人数据→统一多任务策略
RT-2:互联网VLM+机器人数据→VLA
π0:预训练VLM+多本体数据+连续动作专家→通用机器人基础模型
RT-1解决的是“能不能用一个模型学习大量机器人任务”;RT-2进一步解决“能不能把互联网知识迁移给机器人”;π₀则进一步加强动作侧,使用专门Action Expert和Flow Matching生成连续、多时间步动作。
7.4 整体总结
RT-1的完整过程可以压缩为:
成功Episode→切分为观察—动作训练样本
语言指令→USE句子向量→FiLM调制视觉特征
6帧图像→EfficientNet→每帧81个视觉语言Token
TokenLearner→每帧8个Token→共48个时序Token
Transformer→11维动作Token→反量化
底层控制器执行→获得新图像→继续闭环预测
RT-1需要重点记住八点:
①RT-1是语言条件下的大规模多任务机器人策略,不是互联网VLM意义上的完整VLA;
②一条Episode会沿时间轴切成很多“语言+最近6帧图像→专家动作”的训练样本;
③训练标签是遥操作员真实下发的动作指令,不是根据6帧图像差计算出的实际位移;
④语言先经过USE变成句子向量,再通过FiLM写入视觉特征;
⑤视觉Token是CNN特征图展开得到的连续向量,不是语言词表编号;
⑥TokenLearner将每帧81个Token软聚合为8个,使6帧总共只保留48个Token;
⑦模型并行预测一组离散动作Token,动作Token与语言词表无关;
⑧RT-1通过行为克隆和短周期闭环控制完成多任务机器人操作,并为RT-2和后续VLA基础模型奠定了统一策略和数据规模化基础。
哲学视角
“机器人不是先听懂语言,而是先学会带着指令看世界。”
——当语言指令经USE压成句子向量,FiLM把任务写入视觉特征,TokenLearner将每帧81个位置收束为8个Token,Transformer再从6帧、48个时序Token中预测11维动作,RT-1便把“理解”落到了夹爪、底盘与终止信号上;而3Hz的观察—动作—新观察闭环,又让每一次执行都接受现实纠偏。它表面上是在训练机器人听话,本质上是在把语言翻译成选择、把感知翻译成行动。真正改变的不是机器多会识别物体,而是它能否在连续反馈中,把一句指令变成一条可修正、可复现、可扩展的行动路径。
结尾语:如果本文对您有帮助,请点赞鼓励一下,这对我真的很重要。您的每一次鼓励,都是我继续创作的动力,谢谢啦!下次见。