news 2026/10/11 8:42:53

视觉丢帧也能停靠!南科大周博宇团队提出 PerchRL,让无人机自主权衡“继续逼近”与“恢复视觉”

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
视觉丢帧也能停靠!南科大周博宇团队提出 PerchRL,让无人机自主权衡“继续逼近”与“恢复视觉”

「两阶段训练 + 主动感知奖励」

目录

01 PerchRL完整技术链路

1.1 动力学感知时空轨迹随机化(预训练数据底座)

1.2 状态预训练阶段

1.3 可见度感知混合引导:视觉微调核心模块

02 仿真消融与真机实验

03 写在最后


空地协同体系中,无人机自主停靠在运动倾斜平台上,是移动补能、应急物资投送的核心能力。

但野外环境没有定位基站,机载视觉成了成本最轻、部署最灵活的感知手段——代价是视场角存在物理上限。

高速敏捷逼近时,目标平台很容易跑出画面。视觉观测一旦间断丢失,平台状态估计中断、预测可信度无从判断、恢复视野的机动又和逼近停靠的动作互相冲突,三者任意一环失效,任务直接失败。

南方科技大学周博宇团队提出PerchRL强化学习框架:状态预训练加视觉微调两阶段学习,动力学感知时空轨迹随机化生成大量物理可行的平台运动,可见度感知输入增强把估计可信度交给策略感知,搭配主动感知奖励,让无人机自主权衡“继续逼近停靠”和“恢复视觉观测”。整套框架实现仿真到真机零样本迁移,在多款真实四旋翼平台上完成验证。

01 PerchRL完整技术链路

整套流程分为状态预训练、基于视觉的微调两大阶段。预训练阶段利用仿真真值状态学习敏捷拦截、末端对齐;微调阶段接入带噪声、会间断的视觉观测,适配真实感知退化;部署时外接即插即用的视觉检测模块输出位姿观测。

图 | PerchRL完整系统总览,包含训练流水线与真机部署架构

1.1 动力学感知时空轨迹随机化(预训练数据底座)

为了不让策略死记少数几条运动轨迹,论文提出动力学感知时空轨迹随机化。 空间层面:生成周期性均匀B样条参考轨迹,再做全局曲率校验,通过二分搜索修正控制点,严格满足差分驱动地面小车运动曲率上限,保证生成轨迹物理可执行。 时间层面:引入奥恩斯坦‑乌伦贝克时序相关速度扰动,给平台速度叠加平滑变化噪声,避免独立高斯噪声带来的跳变,贴近真实地面车辆速度演化特性。 整套管线可以批量产出大量平滑、动力学合法的平台运动,让策略接触足够丰富的运动样本,缓解过拟合。

1.2 状态预训练阶段

该阶段策略可以直接读取仿真内部平台真值状态,不需要视觉输入。 观测包含无人机本体状态、平台历史时序观测序列、上一步动作;利用TCN时序卷积网络编码平台历史观测,挖掘平台潜藏运动趋势;非对称Actor‑Critic架构,Critic额外输入未来平台特权状态,得到更精准价值估计,辅助Actor学习。 奖励分为稠密塑形奖励与稀疏终端奖励。稠密奖励引导相对位姿收敛、动作平滑、限制激进机动;稀疏终端奖励判断接触时刻是否满足停靠容差,成功停靠还会根据对齐精度附加奖励,鼓励高精度停靠,而不是仅仅完成接触。

图 | 多种仿真轨迹可视化以及基线、消融方案成功率对比柱状图

1.3 可见度感知混合引导:视觉微调核心模块

进入视觉微调,任务变为部分可观测马尔可夫过程,平台观测会随视场丢失发生中断。整套模块由可见度门控观测模型、可见度感知输入增强、主动感知奖励三部分组成。

1.可见度门控观测模型仿真模拟机载相机成像逻辑,平台离开视场就丢弃视觉测量;观测有效时输出带各向异性噪声的6自由度平台位姿,模拟真实检测模块的感知退化。

2.可见度感知输入增强采用CTRV恒定转弯率扩展卡尔曼滤波做状态递推,视觉有效时利用观测更新滤波,视觉丢失就依靠模型做预测外推。 额外新增可靠性指标ρₜ,随视觉丢失的持续时间指数衰减,代表当前滤波估计的可信程度。该指标直接送入策略网络,让无人机自己知道“现在的平台估计结果可能已经不准”,为行为切换提供依据。

3.主动感知辅助奖励光有输入增强不足以引导行为,配套两项辅助奖励:一项惩罚估计误差随丢失时长放大;另一项鼓励相机光轴对准目标平台。

设计逻辑:不是只要一丢画面就强制扭头找目标;估计可信度还比较高时,可以继续执行逼近机动;只有当可信度不断下降,策略才主动优先恢复视觉观测,实现停靠进度与感知恢复之间的自主权衡。

02 仿真消融与真机实验

仿真大规模并行训练,同时开展多组基线与消融;真机使用多款四旋翼,地面小车搭载70°倾斜停靠平台,测试随机样条运动轨迹。评测指标主要看不同速度、倾斜角度条件下的停靠任务成功率。

表|训练与评估初始化参数分布表

仿真设置往复直线、环形跑道、8字、随机B样条四类轨迹,对比模型规划方案FastPerching、强化学习基线InclineLander,以及去掉时序增强的消融版本PerchRL w/o TA。 在多样运动模式下,完整PerchRL方案整体成功率领先基线;消融实验证实:去掉时序增强模块,对未知轨迹泛化能力明显下滑。

图 | 成功率、平均视觉可靠性ρₜ训练曲线图

真机零样本迁移测试,直接把仿真训练策略部署实机,不做任何真机微调。地面小车执行随机生成的样条轨迹,平台速度持续变化,停靠过程中多次发生目标短暂丢失再重检测。

图 | 真实世界敏捷停靠定性结果图,包含飞行轨迹、速度时序曲线与硬件实拍

真机可以完成:平台高速不规则运动、间歇性视觉丢失条件下的敏捷停靠。也可以观察出现象:如果视觉丢失持续时间过长,滤波外推漂移累积,依然会停靠失败。

指标边界解读:真机验证是室内环境,没有强阵风扰动;仿真‑零样本迁移不代表完全无视现实扰动;室外强风大扰动条件,性能会发生衰减。

03 写在最后

PerchRL直面无人机敏捷停靠的一个现实痛点:机载视场有限,真实任务里视觉目标丢失是常态,不能假设全程观测都完好。来自南方科技大学周博宇团队的这套工作,跳出了“必须全程锁定目标”的训练前提。

它没有走硬编码“丢画面就立刻回头找目标”的简单逻辑,而是通过两阶段训练、大规模物理可行轨迹随机化,再用输入增强把估计可信度交给策略感知,搭配主动感知奖励,让强化学习自己学会权衡继续逼近还是恢复视觉。仿真训练完成后直接零样本部署真机,给运动倾斜平台的敏捷停靠提供了一套RL路线的完整方案。

图 | 真机实验定性结果,机载视角、地面视角、飞行轨迹与时序状态曲线

但也要客观看待边界:这套方法不是无限抗视觉丢失,短时丢失可以靠滤波外推过渡;长时间完全看不到目标依旧会漂移。同时强风等大扰动下性能会衰减,距离复杂室外真实空地协同大规模落地,还有进一步迭代空间。

参考论文:

论文标题:PerchRL: Vision‑Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion

论文链接:https://arxiv.org/pdf/2606.03441v3

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/11 8:41:54

OneNET API批量创建设备:获取设备ID与密钥的自动化实战指南

1. 为什么不用控制台,而是用API批量创建设备做物联网平台接入的朋友应该都有这种体会:产品还在原型阶段,设备数量只有三五台的时候,在OneNET控制台手动点“添加设备”完全不觉得有什么问题。但一旦进入小批量测试,比如…

作者头像 李华
网站建设 2026/10/11 8:41:28

短命名中间层项目设计指南:从适配执行层到高可用架构实践

1. 从“rea”这个标题说起:一个被低估的通用缩写第一次看到“rea”这个标题的时候,我脑子里蹦出来的第一反应是——这大概率又是一个被缩写玩坏的项目名。在技术圈混久了你会发现,越是短到只有三个字母的标题,背后藏的东西往往越不…

作者头像 李华
网站建设 2026/10/11 8:40:37

2027 高考物理题型突破资料 掌握解题大招攻克物理重难点

这套2027高考物理备考资料全套分为三本,将习题训练、题目解析、方法总结分开成册,形成完整闭环学习素材。新高考物理考题模型复杂,很多同学能背公式,但遇到综合大题不知道如何切入,这套资料就针对该痛点,把…

作者头像 李华
网站建设 2026/10/11 8:34:07

社区环保教育如何落地?从观澜社案例拆解项目设计与实操

最近两年“社区环保教育”这个组合在公益圈里越来越热,我接触过不少社区组织都在做类似的事,但大多停留在“拉个横幅、发发传单、拍几张合照”的阶段。真正把环保教育做成体系、让居民愿意跟着学、跟着改的,少之又少。所以当我看到观澜社张庆…

作者头像 李华
网站建设 2026/10/11 8:34:00

Gitee远程仓库的部署和连接

安装Gitee需要的软件建议安装在这个路径 因为第二个软件会自动找这个软件 一路next查看是否安装成功安装第二个软件一路next配置的用户名是Gitee网站的用户名不带符号 邮箱是注册时的邮箱软件装好的标志在Gitee上创建远程仓库创建成功的标志 https://gitee.com/to-be-waited-fo…

作者头像 李华