前言
关于智能跟随,一直是机器人的一个重要课题,本博客中之前也解读过类似的框架,比如
- TrackVLA与其plus升级版——开放世界下的四足具身视觉跟踪EVT(智能跟随):集目标识别与轨迹规划为一体的VLA,不怕高动态与遮挡
- Uni-NaVid(NaVid升级版)——基于视频和指令规划动作:通过在线Token合并和前瞻性预测,试图一统“智能跟随”等4类导航任务
考虑到我司「七月具身」最近新签的一个合同 又涉及到了“智能跟随”功能的开发,虽然之前搞过智能跟随,但更好和优化总是无止境的
故在继续探索的过程中关注到了本文要介绍的:ReferTrack,一种在单个前向摄像头条件下实现EVT 落地的” 指代-再跟踪” 范式。该模型首先从一个索引化的边界框集合中选出目标,然后在这一基于图像决策的条件下解码跟踪航点
EVT 是 Embodied Visual Tracking 的缩写,中文通常译为具身视觉跟踪。
在这篇文章中,它指:机器人只依靠自身搭载的摄像头,根据自然语言描述识别目标人物,并持续规划运动轨迹进行跟随。
例如指令是“跟着穿黑色 T 恤和短裤的人”,机器人需要同时完成两件事:
目标识别:从多个人中找出正确的目标
轨迹规划:控制自身移动,与目标保持合适距离,同时避免碰撞
简单来说,EVT 就是让机器人做到:“听懂要跟谁、在画面中认出谁、并亲自移动着跟上谁”
为在时间上保留目标运动线索,ReferTrack 维护一个先前所选边界框的滑动窗口队列,并通过时间-视角-边界框指示符(TVBI)token 将它们的几何特征注入视觉历史中
第一部分 ReferTrack: Referring Then Tracking for EmbodiedVisual Tracking
1.1 引言与相关工作
1.1.1 引言
具身视觉跟踪(Embodied Visual Tracking, EVT)
- TrackVLA
- TrackVLA++
- AD-VAT+
- Empowering Embodied Visual Tracking with Visual Foundation Models and Offline RL
- Instance-Level Visual Active Tracking with Occlusion-Aware Planning(2026):面向实例级视觉主动跟踪,引入遮挡感知规划,以改善目标短暂不可见时的持续跟随能力]
要求一个移动智能体在仅依赖机载视觉的条件下,持续跟随由自然语言描述的特定目标。在拥挤且动态的环境中,成功关键在于两种紧密耦合的能力:
- 目标识别——判断哪一位行人符合给定指令
- 以及轨迹规划——生成避免碰撞的运动轨迹,同时将目标保持在合适的跟随距离内
具体而言
- 早期的处理流程通常将这两个阶段分开处理,利用视觉基础模型
6-Segment Anything
7-SAM 2
8-Grounding DINO,详见本博客中的解读《IDEA-Research推出的一系列检测、分割模型:从DINO(改进版DETR)、Grounding Dino、DINO-X到Grounded SAM2》
进行目标识别,再采用后续的基于学习的规划器进行导航 [4,5] - 最新的视觉-语言-行动(vision-language-action, VLA)模型将目标识别与路径规划统一到一个单一策略中,并采用大语言模型(LLMs)
1,2
9-NavFoM
10-CoMaTrack: Competitive Multi-Agent Game-Theoretic Tracking with Vision-Language-Action Models
11-Uni-NaVid
12-VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory
13-ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation
的“下一 token预测”范式
一些方法 [9,10,11,12,13]将
EVT
与
其他导航任务
例如,视觉-语言导航[14-Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments]
目标物体导航 [15-HM3D-OVON]
点目标导航 [16-SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation]
进行联合训练,使模型能够学习通用的导航先验,并仅凭海量数据就获得基础的 EVT 能力 - 相比之下,专门化方法 [1,2] 则专注于 EVT 和以目标识别为驱动的问答(QA)数据集构建。通过显式地针对识别与规划进行优化,它们在只需少量训练数据的情况下,就能取得相当甚至更优的性能
在此基础上,TrackVLA++ [2] 通过在动作预测之前引入具备空间感知能力的 token,加入链式思维(chain-of-thought, CoT)推理
————
然而,只在抽象的空间潜在空间中进行推理,往往难以在复杂、拥挤的场景中实现精确的视觉对齐(visual grounding)
为了解决这一问题,来自的研究者提出了一种互补的范式:先指代(referring),再跟踪(tracking)。即并非依赖抽象的空间编码,而是将目标识别表述为:从自我视角图像中检测到的一组图像空间边界框(bboxes)中,选择一个带索引的条目,这样就把识别问题转化为一个受约束的多选问题 [17-Referring to Any Person],更易于监督训练,也更符合 VLM 的语义对齐(grounding)机制
在这一表述基础上,作者提出了ReferTrack
- 其paper地址为:ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- 其GitHub地址为:github.com/MedlarTea/referTrack
——
截止到26年9月中旬,下述第一项已发布,其余项待发布
Release model checkpoints and evaluation code.
Release the dataset.
Release the training code.
Release the data engine.
具体而言,这是一种 VLA 模型
- 它将当前检测结果组织成一个带索引的 bbox 目录,预测单个 Refer-CoT token(包括⟨NO EXIST⟩),并通过滑动窗口队列传播所选目标的 bboxes,在轨迹预测之前注入运动线索Refer-CoT:单 token 的目标指认
Refer-CoT可以理解为一种压缩到只有一个特殊 token 的“指认推理”。
在当前帧 T ,模型先从候选目录中选择一个目标:
例如:
输出
⟨ped_2⟩:说明语言指令描述的是当前第 2 个候选行人;输出
⟨NO_EXIST⟩:说明目标当前不在视野中它不是一段自然语言 Chain-of-Thought,而是一个离散候选索引 token。第一个 LLM 先生成它,第二个 LLM 再把它作为条件前缀来生成动作
一句话概括:Refer-CoT 回答:“现在应该跟谁?”
- 为了在在线跟踪之前进一步增强这种指代能力,作者在一个自构建的 Refer-QA 数据集上对 ReferTrack 进行联合训练——该数据集源自一个行人ReID数据集 [18-PLIP: Language-Image Pre-training for Person Representation Learning]——并采用与上述相同的带索引 bbox 选择接口
因此,ReferTrack 建立了一条紧凑的、以图像为基础的 CoT 通路,将自然语言、视觉检测和运动线索无缝集成到一个端到端策略中
1.1.2 相关工作
首先,对于视觉-语言导航
视觉与语言导航(Vision-and-language navigation, VLN)要求智能体在自然语言指令的引导下到达指定目标。早期方法利用场景的文本描述对现成的大型语言模型(LLMs)进行提示式调用 [19-LM-Nav,20-NavGPT]
而最近的模型则在导航轨迹上对视觉-语言模型(VLMs)进行端到端微调 [11,21-NaVid,22-NaVILA,23-StreamVLN,13]
例如
- Uni-NaVid [11] 通过跨任务模仿学习泛化的导航能力
- NavFoM [9] 则通过时间-视点指示(temporal-viewpoint indicator, TVI)token 对视觉历史进行结构化建模,从而显式编码时空上下文
ReferTrack 延续了这种结构化视觉历史建模思路,但进一步通过时间-视点-边界框指示(temporal-viewpoint-bboxindicator, TVBI)token 注入被指称目标的几何特征。一旦通过 Refer-CoT token 完成目标识别,其历史边界框就会被排队并进行融合进入视觉流
——
TVBI全称是Temporal-Viewpoint-Bbox Indicator,是在 TVI 的基础上加入目标 bbox 几何信息
论文中的定义是:
其中::表示这一帧的时间和视角信息
:该历史帧中被引用目标的归一化边界框
:把 bbox 映射到 LLM 可理解的隐空间
如果历史帧中目标不可见,就使用:
作为明确的“目标缺失”标记
TVBI 只用于历史帧;当前帧仍然只使用 TVI,不直接注入当前 bbox。这样模型必须利用“历史目标几何 + 当前原始视觉”重新定位目标,而不是简单复制上一帧答案。
一句话概括:TVBI 回答:“过去那个目标在哪里,它是怎么移动的?”
——————
该机制有效地将通用的时空索引转化为一种以目标为条件的记忆,用于持续跟踪
我再用一个表格帮大家总结下TVI与TVBI的本质区别
对比维度
TVI
TVBI
本质差异
全称
Temporal-Viewpoint Indicator
Temporal-Viewpoint-BboxIndicator
TVBI 多了 Bbox
编码对象
时间顺序 + 视角信息
时间顺序 + 视角信息 + 目标边界框
从“组织历史”升级为“记住目标”
论文公式
TVBI 把目标几何直接加进指示 token
是否知道目标位置
不知道
知道历史帧中的目标 bbox
这是两者最核心的区别
是否绑定具体目标
不绑定,只描述帧的时空上下文
绑定 Refer-CoT 选中的目标
TVBI 是目标条件化记忆
bbox 来源
无
Refer-CoT 选中候选后写入历史 bbox 队列
TVBI 依赖“先指认”的结果
目标缺失时
不涉及
使用 [0,0,0,0] 表示该历史帧无可靠目标框
能区分“目标移动”与“目标缺失”
在 ReferTrack 中的位置
当前帧仍使用 TVI-only
历史帧使用 TVBI
当前帧不直接注入 bbox,迫使模型重新定位目标
解决的问题
让模型理解帧与帧的时间、视角关系
让模型理解“被选目标如何随时间移动”
从通用时空索引变成跟踪记忆
其次,对于具身视觉跟踪
- 具身视觉跟踪(Embodied Visual Tracking, EVT)要求一个移动智能体持续追踪由自然语言指定的动态目标
早期方法通常将感知和控制解耦,将视觉基础模型 [6,8] 与后端的强化学习
或
模仿学习[24-Towards Distraction-Robust Active Visual Tracking(2021):通过多智能体混合博弈等机制,提升主动视觉跟踪在外观相似干扰者存在时的鲁棒性,4] 进行组合
尽管这类模块化流水线在可解释性上具有优势,但识别阶段的错误不可避免地会累积并传递到规划模块 - 近期的 VLA 模型则将语言、视觉与控制统一起来以解决 EVT 问题 [1,25-LOVON,2,10]:
TrackVLA [1] 将目标识别与轨迹规划整合为单一策略;
LOVON [25] 采用分层式LLM 规划器并配合低层控制器;
TrackVLA++ [2] 在利用极坐标 token 进行航点预测之前,引入时序记忆和具备空间感知的推理机制
ReferTrack 同样采用“先推理、后行动”的范式,但其推理所使用的词汇是在已索引的图像空间 bbox 之间进行选择,而非抽象的极坐标
这样的设计与 VLM 自然使用的、以及机载检测器输出的以 bbox为中心的表征形式显式对齐,从而将推理过程锚定在直接的视觉证据之上,并最大限度地减少由抽象带来的瓶颈
最后,指代、定位与基于目录的识别
- 指代表达理解(Referring Expression Comprehension,REC)基于自由形式的自然语言对目标进行定位 [26-ReferItGame,27-RefCrowd]
开放词表检测器和定位(grounding)模型 [8,28-Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V] 进一步在语言与图像区域之间建立桥梁,并且愈来愈多的多模态大模型(multimodal LLM)被设计为将边界框(bbox)作为 token 输出,或在候选区域提议之间进行选择
29-Shikra
30-Ferret
31-Groma
32-ChatRex
33-LISA++ - 在以人为中心的场景中,像 RexSeek [17] 这样的框架可以检测出所有与给定描述匹配的个体,这启发了作者的 Refer-QA 协同训练:即在离线阶段强化基于目录的指代表达能力,并将这一能力迁移到在线 EVT 跟踪中
总体来看,这些工作表明,从离散候选中进行选择是视觉-语言模型(VLM)的自然交互方式。更重要的是,将 EVT 识别表述为在带索引的图像空间边界框之上的指代任务,也解锁了稀缺的专家级跟踪轨迹之外的监督信号:互联网提供了大规模的指代与定位数据 [26,8,17],而机器人学 [34,35] 和自动驾驶 [36,37] 则提供了大量带有二维行人标注的自中心视频,可以用来填充候选目录
这种兼容性为在 EVT 驱动的视觉-语言智能体(VLA)中扩展识别能力提供了一条可扩展途径,而无需完全依赖昂贵的闭环导航数据
在本文中,为了与先前 EVT 工作 [1,2] 进行公平比较,作者使用相同的人体重识别(person ReID)数据集[18] 来生成 Refer-QA 数据,并将由此学到的带索引 bbox 选择能力迁移到在线跟踪中
1.2 ReferTrack的完整方法论:涉及模型架构
1.2.0 问题表述与概述
首先,是任务表述
具身视觉跟踪(EVT)要求一个移动智能体仅依靠机载视觉,持续跟随由自然语言描述的特定人物,这一能力是建立长期陪伴关系和具备社会感知交互的基础
- 在每个时间步
,给定关于目标外观的指令
和一串前向视角的RGB 观测
,智能体预测一条连续轨迹
- 每个航路点
表示在地面平面上的自中心位移和朝向变化
遵循既定的评估协议,当智能体在保持规定的跟随距离(1-3 米)的同时,将目标持续保持在其视野内时,该回合被视为成功
其次,对于模型概述
ReferTrack 将最新的VLA 框架[1, 2, 9] 扩展为一个为同时执行导航和问答而定制的双分支架构
- 对于导航,作者使用鲁棒的视觉编码器和跨模态投影器[38] 对前视观察历史
进行编码,以获得视觉token
,然后使用受NavFoM 风格TVI 编码[9] 启发的时序-视角-边界框指示符(TVBI)token 对其进行结构化
与此同时,时间步T 的行人检测结果被组织成一个带索引的候选目录。每个条目对应一个通过基于MLP 的投影器P bbox 编码的检测到的行人边界框。指令
按照标准多模态训练实践被token化为语言嵌入
视觉tokens、catalog 和 language tokens 被连接起来,并在两阶段顺序地输入到一个大型语言模型中:
其中 E 指的是 T ∈ {⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO EXIST⟩},用于选择一个带索引的 bbox 条目。其中的 ⟨NO EXIST⟩该 token 明确表示当前前向视野中不存在目标
作者采用这种图像空间的指代策略——选择与匹配的索引 bbox 条目——因为它通过一个紧凑的单 token 选择——即Refer-CoT,将目标识别与 VLM 的指代/对齐机制自然衔接在一起
- 对于问答任务,作者复用同样的目录接口,引导模型基于自构建的 Refer-QA 数据集,选择与目标描述相匹配的索引 bbox 条目
导航数据与 Refer-QA 样本进行联合训练。图 2 总结了完整的 EVT 推理流程
的
ReferTrack 首先通过从当前检测结果中选择一个带索引的边界框(bbox),对语言指令和视觉流进行对齐与关联,然后在该 Refer-CoT 决策的条件约束下预测跟踪航点。被选中的边界框会作为目标特定记忆进行存储,并通过 TVBI token注入到后续的视觉历史中
1.2.1 ReferTrack 架构:观测编码、候选目录、Refer-CoT和轨迹预测、引用目标边界框队列、训练目标等
第一,对于观测编码
- 作者处理在线前视流
,采用双编码器架构,从SigLIP [39] 和DI-NOv2[40] 中提取并拼接视觉特征
之后,应用grid pooling 策略[21] 生成细粒度tokens以捕获当前观测的细节信息,以及粗粒度tokens
以保留更广泛的历史上下文,其中C 表示通道维度
- 为在长程上下文和推理延迟之间取得最佳平衡,维护最近H 帧的滑动窗口
因此视觉流被组织为
一个两层MLP 投影器将视觉流映射到LLM 潜空间,生成
在输入LLM 之前,作者在帧视觉token 组之间交错插入时间-视角-边界框指示符(TVBI)tokens,从而将目标几何显式注入到视觉历史中 - 给定一个有效的归一化框
,然后通过共享的两层MLP
对其进行嵌入(稍后在目录编码中复用),并将其加到TVI token 上[9]——定义为公式2:
如果在历史帧中目标未被观测到,作者将设为一个确定性的缺失哨兵
这表明该帧没有可靠的目标几何信息可用,从而使TVBI 能够区分可见的目标运动和目标缺失的历史 - 在导航过程中,长度为H 的参考目标边界框队列对历史TVBI 流进行显式条件建模,而当前帧的精细token 严格依赖仅由TVI 提供的指示信息
通过剥夺在当前观测中不再显式注入边界框的情况下,模型被迫只能依赖历史 TVBI 线索和原始视觉特征,对目标进行空间和时间上的定位,从而为后续的指代表达任务建立稳健的表示
第二,对于候选目录
图像空间中的指代表达需要在每个步骤为 LLM 提供一组离散的行人候选以供评估 [17]。在时间步 T,作者在当前前视图图像上运行一个现成的实时目标检测器 [41]。检测到的行人会被整理为一个带索引的目录 C_T ={⟨ped1⟩, …, ⟨pedK⟩, ⟨NO EXIST⟩}
- 如果场景中包含的行人数超过 K 个,作者会根据边界框面积优先选择前 K 个候选
此外,还会始终包含一个固定的虚拟索引 ⟨NO EXIST⟩,用于处理指令目标在智能体周围环境中完全不存在的情形 - 为了将
格式化为适用于LLM 的形式,每个候选条目由一个专用的标识符token
后接一个bbox token 来表示
对于一个有效的归一化框,bbox token 通过
计算,采用与式(2)
中定义的相同P bbox 结构
在建立了视觉历史和离散候选空间之后,LLM 融合语言指令以选出真实目标。最终,模型通过自回归的下一个token 预测输出对应的候选索引(即Refer-CoT token E referT)
第三,对于Refer-CoT和轨迹预测
给定指令、候选目录
和自中心视觉历史,ReferTrack 在运动规划之前显式地对目标进行指代定位
- 在第一次LLM 前向传播(Eq. (1))中,模型通过在已注册的特殊token离散词表上进行分类步骤,生成单个Refer-CoT token
:{
, ⟨NO_EXIST ⟩}
关键在于,目标选择始终是对索引边界框的一次单token决策,从而使推理步骤保持紧凑并可被直接监督。若目标不可观测,模型预测⟨NOEXIST ⟩;否则,它输出与最匹配的索引
- 随后,LLM 使用
作为条件前缀生成一个动作token
,一个专用的MLP 头将其解码为
个航点
第四,对于引用目标边界框队列
一旦被解析,就从中提取相应的边界框(bbox)来自选定的目录条目,并将其压入一个容量为
的先进先出(FIFO)队列 Q 中,用于未来的历史编码
- 在第 T 步时,当前观测本身仍然是仅 TVI;而历史 TVBI 流则以之前的队列
作为条件
在第 T 步的Refer-CoT决策中,新选出的 bbox会被追加到队列末尾,形成供下一个时间步使用的队列。在训练阶段,队列 Q 使用真实标注的跟踪数据进行填充
- 为增强鲁棒性,作者通过偶尔注入一个错误的目标索引(例如,另一个行人或 ⟨NOEXIST⟩)来引入随机噪声,从而有效地模拟历史跟踪误差
在推理阶段,队列则以内推(自回归)的方式更新,每一步都使用 Refer-CoT 选出的 bbox。正如在观测编码中所设定的,这些存档的坐标只会被历史 TVBI token 消费,而不会被当前帧的 fine token 使用
这一显式记忆机制闭合了推理环路:Refer-CoT 决定“跟踪谁”,而队列则将这一决策传播到几何历史中,用以锚定所有后续的规划
第五,对于训练目标
- 为了将视觉-语言推理与机器人控制紧密结合,Refer-Track 采用全量微调策略,同时更新整个大语言模型(LLM)的参数以及辅助的视觉和动作模块
整体框架通过三个不同损失函数的加权和进行优化:
其中是一个设置为10 的常数缩放因子
- 对于导航轨迹,
通过最小化
预测航路点
与
专家航路
之间的均方误差(MSE)
来监督动作头: - L refer 项监督Refer-CoT 推理步骤,通过交叉熵训练模型去预测真实的目标索引E refer,gtT∈{⟨ped1⟩, . . . , ⟨pedK⟩, ⟨NO_EXIST ⟩}:
最后,对于Refer-QA 样本,L text 在文本token 上计算标准的交叉熵。该损失有意绕过action head,以使梯度更新完全专注于视觉指称和语言对齐
1.2.2 训练
ReferTrack 在两个互为补充的数据集上进行训练,这两个数据集共享统一的索引边界框(indexed-bbox)目录表示形式
- Navigation data 包含 130 万条专家跟踪轨迹,这些轨迹是从 Habitat 3.0 模拟器 [42] 中 EVT-Bench 训练划分 [1] 精选而来
每个样本提供前视观察、自然语言目标描述、基于检测的候选目录、真实的 Refer-CoT 索引以及专家路径点 - Refer-QA data 融合了 130 万条自定义构建的指代样本,这些样本由 SYNTH-PEDES [18] 合成而来——该数据集与以往 EVT 方法 [1,2] 使用的数据完全相同——以显式增强视觉指代表达(visual grounding)能力
最终,作者按照 1:1 的比例对这两个数据源进行联合训练,并遵循 TrackVLA [1] 中的两阶段有监督微调(Supervised Fine-Tuning,SFT)方案:
- 第 1 阶段使用通用的多模态问答数据集 [38,43] 对视觉投影器进行对齐
- 第2 阶段在共享的输入布局下,对导航任务和 Refer-QA 任务同时进行全量微调
由于这两个任务在语言指令、离散目录以及组织化视觉 token 的顺序上完全一致,因此,从静态问答监督中学到的稳健指代能力能够无缝迁移到动态的在线跟踪中。更多细节见附录
首先,对于专家跟踪数据整理
- 作者从Habitat 3.0 [42] 中的EVT-Bench 训练划分[1] 获取专家跟踪轨迹。由于以往的专家轨迹筛选流程仍为专有,作者实现了一个自定义的oracle 控制器,该控制器可以访问机器人和被指示的人形目标的模拟器状态
在每个仿真步,控制器从机器人到目标查询Habitat的测地线最短路径规划器,对返回的路径进行加密,并选择一个局部前瞻航点,使机器人保持在偏好的跟随距离1.2 m 附近
当目标经过大转弯时,控制器切换为追逐路径中的中间点;当目标接近机器人或机器人过于靠近时,它会在机器人后方计算一个后退目标点以恢复跟随距离
选定的局部目标由具有加速度平滑的PD 速度控制器进行跟踪,生成底盘差速速度指令,作为航点/动作监督信号
- 在执行 rollout 过程中,作者逐步记录机器人和目标的位姿、专家的底盘速度,以及从全景分割观测中提取的目标边界框(bbox)
只有当 Habitat 的跟随指标在整个过程中始终保持成功、且无碰撞或长时间目标丢失时,该回合才会被接受作为专家示范;失败的rollout 则会单独存储以便检查
具有代表性的专家行为如图 4 所示
在指令“跟踪穿着红黄相间超级英雄服装的人。”的条件下,oracle 控制器展现出多样的跟随行为,包括:当目标接近时后退、在大转弯处追踪中间航路点、正常的后侧跟随,以及在目标停止时随之停止(从左到右)
————
作者将整理后的成功轨迹下采样至 33 万个样本,用于单目标跟踪(Single-Target Tracking, STT)和歧义跟踪(Ambiguity Tracking, AT),并保留所有 64 万个分心跟踪(Distracted Tracking,DT)样本,以在存在干扰的情况下提升目标识别能力,最终共得到 130 万个导航样本其次,对于Refer-QA 数据生成
- 作者将辅助监督形式化为一个结构化的refer-QA 任务,以反映在线目录界面。为了与先前的EVT 方法[1, 2] 进行公平对比,作者使用相同的SYNTH-PEDES [18] 数据集来生成他们自己的refer-QA 数据,示例如图5 所示
作者通过将 2–3 个带有字幕的行人裁剪图像合成到多样化背景上来合成多人的指代表达样本,并监督模型从中选择被查询的带索引边界框(bbox),或选择⟨NO EXIST⟩
示例提示词:对于图5中的第一张图,候选库中包含索引 12,对应 bbox [72,35,230,352];索引 17,对应 bbox [253,41,376,288];以及一个缺失的负向描述,对应的 bbox 为 [0,0,0,0],用⟨NO EXIST⟩表示
一个正向查询为:“Please find ⟨a man in his forties is wearing a white cap, white shirt, and a pairof black pants⟩ in the video. Answer with object indexes.” 其监督答案为索引 12- 对于每个样本,作者裁剪背景图像的底部区域,将其调整为384 × 384 大小,并粘贴2-3 个具有随机尺度且尺度落在[0.75, 1.5] 内的行人裁剪图,同时拒绝重叠的布局
每个粘贴的行人都会被随机分配一个 0 到 19 的目录 ID,并与其图像空间的边界框(bbox)和文本描述一起存储;作者还为其附加一个在图像中不存在的负样本行人描述,并用全零的 bbox 来表示
在训练过程中,有效的行人会被打乱后放入与导航任务相同索引的候选目录中,并在末尾追加一个固定的虚拟 ⟨NO EXIST⟩ 槽位。指令提示为:“Pleasefind⟨caption⟩in the video. Answer with object indexes.”,模型在推理位置被监督去预测正确的 bbox 索引标记;当查询的描述对应的是缺失的行人时,则预测 ⟨NO EXIST⟩最后,对于优化设置
作者遵循已有的多模态预训练实践,采用两阶段的SFT 策略
- 在阶段1 中,我们冻结语言模型和视觉编码器,仅训练视觉投影器P vision ,在通用QA 数据集[38,43] 上以学习率1 × 10−4 训练一个epoch
- 在阶段2 中,遵循TrackVLA++ [2],以1:1 的数据比例在导航和Refer-QA 任务上联合训练模型,训练20 K 步,使用全局batch size 为256
在此阶段,除视觉编码器保持冻结外,所有参数均被更新。且采用带有余弦学习率衰减调度和线性预热的AdamW 优化器。具体而言,LLM 的学习率设为2 × 10−5,其余可训练模块(包括投影器和动作头)的学习率设为1 × 10−4
1.2.3 推理的更多细节(参考原文附录B)
首先,作者在 Unitree Go2 四足机器人和 Unitree G1 人形机器人上测试了 ReferTrack,以评估其在不同具身形态中的真实环境表现
如图 6 所示,ReferTrack 部署在一台远程高性能服务器上。两种机器人平台均配备了一台单目前向摄像头(Intel RealSense D455 摄像头)以及一个便携式Wi-Fi 用于通信
其次,在部署阶段,ReferTrack 作为一个 WebSocket 服务运行在远程 GPU 服务器上。机器人从Intel RealSense D455 相机连续地以 JPEG 压缩的 RGB 帧形式进行数据流传输,并附带语言指令;服务器对每一帧进行解码,更新在线检测器/跟踪器,构建带有索引的边界框(bbox)目录,并返回预测的轨迹以及被选中的目标槽位
为避免在网络抖动情况下产生过期的控制指令,服务器在推理运行期间只保留最新一帧尚未处理的图像,并丢弃“被更新请求所取代的”旧请求
采用了多项工程优化以降低延迟
- 首先,模型检查点只在服务器启动时加载一次,而每个机器人连接各自拥有独立的流式会话
- 其次,在开启该功能时,作者使用torch.compile 对 LLM 进行编译,并执行若干次预热步骤,使得后续的在线推理能够达到稳定状态
- 第三,特征提取实现了并行化:当前 RGB 帧的 DINO 和 SigLIP 特征在不同的 Python 线程中计算,并运行在不同的 CUDA 流上,只在特征拼接前进行同步。拼接后的特征随后通过网格池化,被压缩为当前帧的 64 个细粒度 token,以及历史的 4 个粗粒度 token
在每个时间步,粗粒度 token 会被推入一个固定长度的视觉历史队列,而当前的细粒度 token 保持独立;Refer-CoT 选出的 bbox 也会被追加到目标 bbox 历史队列中,并且仅注入到后续的历史 TVBI token 里
在机器人端,一个纯追踪控制器(pure-pursuit controller)将预测轨迹转换为线速度和角速度控制指令
// 待更