「两阶段训练 + 主动感知奖励」
目录
01 PerchRL完整技术链路
1.1 动力学感知时空轨迹随机化(预训练数据底座)
1.2 状态预训练阶段
1.3 可见度感知混合引导:视觉微调核心模块
02 仿真消融与真机实验
03 写在最后
空地协同体系中,无人机自主停靠在运动倾斜平台上,是移动补能、应急物资投送的核心能力。
但野外环境没有定位基站,机载视觉成了成本最轻、部署最灵活的感知手段——代价是视场角存在物理上限。
高速敏捷逼近时,目标平台很容易跑出画面。视觉观测一旦间断丢失,平台状态估计中断、预测可信度无从判断、恢复视野的机动又和逼近停靠的动作互相冲突,三者任意一环失效,任务直接失败。
南方科技大学周博宇团队提出PerchRL强化学习框架:状态预训练加视觉微调两阶段学习,动力学感知时空轨迹随机化生成大量物理可行的平台运动,可见度感知输入增强把估计可信度交给策略感知,搭配主动感知奖励,让无人机自主权衡“继续逼近停靠”和“恢复视觉观测”。整套框架实现仿真到真机零样本迁移,在多款真实四旋翼平台上完成验证。
01 PerchRL完整技术链路
整套流程分为状态预训练、基于视觉的微调两大阶段。预训练阶段利用仿真真值状态学习敏捷拦截、末端对齐;微调阶段接入带噪声、会间断的视觉观测,适配真实感知退化;部署时外接即插即用的视觉检测模块输出位姿观测。
图 | PerchRL完整系统总览,包含训练流水线与真机部署架构
1.1 动力学感知时空轨迹随机化(预训练数据底座)
为了不让策略死记少数几条运动轨迹,论文提出动力学感知时空轨迹随机化。 空间层面:生成周期性均匀B样条参考轨迹,再做全局曲率校验,通过二分搜索修正控制点,严格满足差分驱动地面小车运动曲率上限,保证生成轨迹物理可执行。 时间层面:引入奥恩斯坦‑乌伦贝克时序相关速度扰动,给平台速度叠加平滑变化噪声,避免独立高斯噪声带来的跳变,贴近真实地面车辆速度演化特性。 整套管线可以批量产出大量平滑、动力学合法的平台运动,让策略接触足够丰富的运动样本,缓解过拟合。
1.2 状态预训练阶段
该阶段策略可以直接读取仿真内部平台真值状态,不需要视觉输入。 观测包含无人机本体状态、平台历史时序观测序列、上一步动作;利用TCN时序卷积网络编码平台历史观测,挖掘平台潜藏运动趋势;非对称Actor‑Critic架构,Critic额外输入未来平台特权状态,得到更精准价值估计,辅助Actor学习。 奖励分为稠密塑形奖励与稀疏终端奖励。稠密奖励引导相对位姿收敛、动作平滑、限制激进机动;稀疏终端奖励判断接触时刻是否满足停靠容差,成功停靠还会根据对齐精度附加奖励,鼓励高精度停靠,而不是仅仅完成接触。
图 | 多种仿真轨迹可视化以及基线、消融方案成功率对比柱状图
1.3 可见度感知混合引导:视觉微调核心模块
进入视觉微调,任务变为部分可观测马尔可夫过程,平台观测会随视场丢失发生中断。整套模块由可见度门控观测模型、可见度感知输入增强、主动感知奖励三部分组成。
1.可见度门控观测模型仿真模拟机载相机成像逻辑,平台离开视场就丢弃视觉测量;观测有效时输出带各向异性噪声的6自由度平台位姿,模拟真实检测模块的感知退化。
2.可见度感知输入增强采用CTRV恒定转弯率扩展卡尔曼滤波做状态递推,视觉有效时利用观测更新滤波,视觉丢失就依靠模型做预测外推。 额外新增可靠性指标ρₜ,随视觉丢失的持续时间指数衰减,代表当前滤波估计的可信程度。该指标直接送入策略网络,让无人机自己知道“现在的平台估计结果可能已经不准”,为行为切换提供依据。
3.主动感知辅助奖励光有输入增强不足以引导行为,配套两项辅助奖励:一项惩罚估计误差随丢失时长放大;另一项鼓励相机光轴对准目标平台。
设计逻辑:不是只要一丢画面就强制扭头找目标;估计可信度还比较高时,可以继续执行逼近机动;只有当可信度不断下降,策略才主动优先恢复视觉观测,实现停靠进度与感知恢复之间的自主权衡。
02 仿真消融与真机实验
仿真大规模并行训练,同时开展多组基线与消融;真机使用多款四旋翼,地面小车搭载70°倾斜停靠平台,测试随机样条运动轨迹。评测指标主要看不同速度、倾斜角度条件下的停靠任务成功率。
表|训练与评估初始化参数分布表
仿真设置往复直线、环形跑道、8字、随机B样条四类轨迹,对比模型规划方案FastPerching、强化学习基线InclineLander,以及去掉时序增强的消融版本PerchRL w/o TA。 在多样运动模式下,完整PerchRL方案整体成功率领先基线;消融实验证实:去掉时序增强模块,对未知轨迹泛化能力明显下滑。
图 | 成功率、平均视觉可靠性ρₜ训练曲线图
真机零样本迁移测试,直接把仿真训练策略部署实机,不做任何真机微调。地面小车执行随机生成的样条轨迹,平台速度持续变化,停靠过程中多次发生目标短暂丢失再重检测。
图 | 真实世界敏捷停靠定性结果图,包含飞行轨迹、速度时序曲线与硬件实拍
真机可以完成:平台高速不规则运动、间歇性视觉丢失条件下的敏捷停靠。也可以观察出现象:如果视觉丢失持续时间过长,滤波外推漂移累积,依然会停靠失败。
指标边界解读:真机验证是室内环境,没有强阵风扰动;仿真‑零样本迁移不代表完全无视现实扰动;室外强风大扰动条件,性能会发生衰减。
03 写在最后
PerchRL直面无人机敏捷停靠的一个现实痛点:机载视场有限,真实任务里视觉目标丢失是常态,不能假设全程观测都完好。来自南方科技大学周博宇团队的这套工作,跳出了“必须全程锁定目标”的训练前提。
它没有走硬编码“丢画面就立刻回头找目标”的简单逻辑,而是通过两阶段训练、大规模物理可行轨迹随机化,再用输入增强把估计可信度交给策略感知,搭配主动感知奖励,让强化学习自己学会权衡继续逼近还是恢复视觉。仿真训练完成后直接零样本部署真机,给运动倾斜平台的敏捷停靠提供了一套RL路线的完整方案。
图 | 真机实验定性结果,机载视角、地面视角、飞行轨迹与时序状态曲线
但也要客观看待边界:这套方法不是无限抗视觉丢失,短时丢失可以靠滤波外推过渡;长时间完全看不到目标依旧会漂移。同时强风等大扰动下性能会衰减,距离复杂室外真实空地协同大规模落地,还有进一步迭代空间。
参考论文:
论文标题:PerchRL: Vision‑Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion
论文链接:https://arxiv.org/pdf/2606.03441v3