news 2026/8/30 7:35:07

CVPR 2026 | MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sense

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
CVPR 2026 | MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sense

基本信息

论文:MM-OVSeg: Multimodal Optical–SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing

作者:Yimin Wei1,2💐; Aoran Xiao2💐; Hongruixuan Chen1,2; Junshi Xia2; Naoto Yokoya1,2📮

单位:1 The University of Tokyo(东京大学);2 RIKEN AIP(理化学研究所 先进智能研究中心)

下载:https://arxiv.org/abs/2603.17528

代码:https://github.com/Jimmyxichen/MM-OVSeg

数据:https://huggingface.co/YiminJimmy/MM-OVSeg/tree/main


MM-OVSeg 开放词汇分割

这篇论文的核心出发点是针对现实遥感场景中云雾干扰导致光学信息丢失的痛点,通过融合具有全天候穿透力的 SAR 图像与光学图像,利用视觉语言大模型的强大泛化性,解决在恶劣天气下对未知类别地物(Open-Vocabulary)进行精准识别与分割的难题。


Q:什么是SAR图像?它有什么特点。

A:SAR(合成孔径雷达)是一种通过主动发射微波并接收回波成像的雷达系统。它具有全天候成像能力,能穿透云雾、黑夜和霾,捕捉地物的结构特征和物理属性。


02 !-OVSeg 技术与方法

  1. 跨模态统一过程(CMU)

    该过程旨在打破模态壁垒,通过 25,087 对无标签的 RGB-SAR 图像对,利用 InfoNCE 对比损失函数进行无监督预训练。在该阶段,RGB DINO 编码器保持冻结,而 SAR DINO 编码器通过学习将雷达特征对齐到已有的视觉基础模型空间中,使模型能够像理解光学图像一样提取 SAR 的密集局部特征。

  2. 多模态密集特征聚合

    在全模型训练阶段,DEF 模块首先从冻结的 RGB DINO 和预训练好的 SAR DINO 编码器中提取多尺度特征。这些特征经过特定层的卷积投影统一维度后,通过元素级加法进行融合,从而将光学图像的光谱语义与 SAR 图像的结构化回波信息有机整合,为后续的像素级分割提供丰富的空间线索。

  3. 全局与局部特征的文本对齐

    为了实现开放词汇识别,模型利用 CLIP 视觉编码器提取全局语义,并与 CLIP 文本编码器生成的类别嵌入进行相似度计算。DEF 模块通过残差增强机制将全局视觉-文本相似度与密集的局部相似度进行拼接融合,这不仅保留了 CLIP 强大的语义泛化能力,还利用多模态特征提升了在复杂环境下(如云雾遮挡)的定位精度。


03 !-OVSeg 实验与结果

为了全方位验证 MM-OVSeg 的性能,论文通过下 Table 1 构建了涵盖清空、薄云、厚云及跨地域泛化等 6 种严苛的实验基准。Table 2 的定量结果显示,MM-OVSeg 在所有设定下均取得 SOTA 性能,其平均 mIoU 达到 51.7%,大幅领先于第二名 GSNet 的 45.6%。上图的定性可视化结果直观证明,在光学图像受云雾严重遮挡时,现有方法大多失效,而 MM-OVSeg 凭借对 SAR 结构信息的成功提取,依然能实现与GT高度一致的精准分割。

通过热力图直观展示了 DEF 模块在不同融合阶段的演进过程。可视化结果表明,CLIP 视觉编码器提取的全局特征 z_rgb 虽能捕捉语义,但定位较为粗糙且易受云雾干扰 ;而经过双编码器融合后的最终表示 h_fuse,不仅在空间定位上更加精细,还能使“已见过”和“从未见过”的类别(如水体、道路)与文本提示实现更精准的对齐。

表 3 和表 4 通过消融实验验证了模型各组件及损失函数的有效性。表 3 结果显示,引入 DEF 模块使 mIoU 提升了 9.1%,而结合 CMU 模块后性能进一步达到 73.1%,证明了多模态融合与跨模态对齐的互补性。表 4 则对比了不同的对齐损失函数,实验证明 InfoNCE 损失在促进 SAR 与 RGB 特征空间一致性方面表现最强,显著优于 MSE 和 L1 损失。


04 MM-OVSeg 创新与总结

  1. 首创全天候遥感开放词汇框架

    针对遥感图像易受云雾干扰的痛点,首次提出融合光学与 SAR 数据的开放词汇分割(OVS)框架 MM-OVSeg 。利用 SAR 的穿透力弥补光学信息的缺失,解决了恶劣天气下对未知类别地物的识别难题 。

  2. 跨模态特征空间的精准对齐 (CMU)

    通过跨模态统一过程(CMU),在 2.5 万对无标签 RGB-SAR 图像上进行对比学习预训练 。该模块成功将 SAR 的特征空间对齐到预训练视觉基础模型(如 DINO)中,打破了模态壁垒 。

  3. 全局语义与局部细节的高效融合 (DEF)

    设计了双编码器融合模块(DEF),同时集成 CLIP 的全局语义泛化性与 DINO 的像素级局部细节 。通过多尺度特征融合与残差增强,显著提升了模型对“未见过”地物类别的分割精度。

本文提出了遥感领域首个融合光学与SAR数据的开放词汇分割框架MM-OVSeg,旨在解决云雾遮挡导致的光学信息缺失难题。通过跨模态统一(CMU)和双编码器融合(DEF)模块,该方法成功实现了雷达与光学特征的精准对齐及全局语义与局部细节的有机整合。多场景实验证明,MM-OVSeg在鲁棒性、泛化能力及分割精度上均显著优于现有的最先进模型。


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 7:34:36

从HashMap到Kafka:Java面试底层原理深度解析

1. 八股文的本质与局限:背下来的答案,始终不是你的先聊几句大实话。我面过不少候选人,也陪身边朋友模拟过很多轮面试。有一种情况特别常见:简历上写着“熟悉Java集合源码”,HashMap的put流程背得一字不差,但…

作者头像 李华
网站建设 2026/8/30 7:34:26

SpringBoot3+Vue2前后端分离CMS内容管理系统实战解析

简介:这是一套面向Java与前端开发者的内容管理系统(CMS)实战项目资源,适用于SpringBoot与Vue技术栈的中高级学习者及全栈工程师,旨在解决传统单体CMS开发效率低、维护难、前后端耦合深等痛点。资源采用SpringBoot3构建…

作者头像 李华
网站建设 2026/8/30 7:33:34

STM32H573 Secure Manager报错-129:PSA密钥生成权限排查与解决

STM32H573 Secure Manager 踩坑实录:psa_generate_key() 返回 -129 的排查全过程 先说我遇到的现象,再带你把这块硬骨头从头到尾啃一遍。我在 STM32H573 上用 Secure Manager 做密钥管理,代码里调用 psa_generate_key() 想生成一个 volatil…

作者头像 李华
网站建设 2026/8/30 7:30:13

MinIO 社区版下载与部署实战:从零搭建对象存储服务

最近看到“黄仁勋向开源社区‘献礼’”这个话题在开发者圈子里讨论度很高,很多文章都在谈开源生态的未来。不过在我看来,开源社区真正的生命力,不只是几家大厂的战略表态,而是每一位普通开发者在日常工作中下载开源软件、阅读源码…

作者头像 李华
网站建设 2026/8/30 7:26:25

科沃斯十四年积累,服务机器人开放生态与应用定义权解析

这几年服务机器人行业有个很有意思的变化:早几年大家比的是“谁的扫地机扫得更干净”,后来比的是“谁的地图更准、避障更聪明”,而现在,头部厂商开始把目光从“卖硬件”转向“做生态”。科沃斯最近提出的“把应用定义权交出来”&a…

作者头像 李华
网站建设 2026/8/30 7:26:03

STM32CubeIDE开发STEVAL-ESC002V1电调固件全攻略

手里这块STEVAL-ESC002V1到手的时候,我本来没抱太大期望——无人机用的ESC板子,接线多、调参烦、资料散,这是我对电调一贯的印象。不过等我在STM32CubeIDE里从零把这块板的固件建起来,再把FOC跑通、电机转顺之后,这套流…

作者头像 李华