news 2026/8/11 10:32:02

【南京理工-AAAI26】用于跨域少样本分割的分层语义学习

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【南京理工-AAAI26】用于跨域少样本分割的分层语义学习

文章:Bridging Granularity Gaps: Hierarchical Semantic Learning for Cross-domain Few-shot Segmentation

代码:暂无

单位:南京理工大学


引言

在计算机视觉领域,“少样本分割”一直是解决数据稀缺问题的核心技术——让AI通过少量标注样本,就能学会分割新类别物体。但现实场景中,训练数据(源领域)和实际应用数据(目标领域)往往差异巨大,比如用鸟类图片训练的模型,很难直接分割医学皮肤病变图或卫星遥感图,这就是“跨域少样本分割(CD-FSS)”的核心挑战。

一、问题背景:跨域分割的“双重鸿沟”

传统跨域少样本分割方法,大多只关注解决“风格差异”——比如把自然照片风格转换成X光片风格。但研究者们发现,还有一个关键问题被忽略了:分割粒度差异

简单说,源领域的前景(比如鸟)和背景差异明显,属于“粗粒度分割”;而目标领域的前景(比如皮肤病变区域)和背景差异极小,更接近源领域中物体内部的细粒度差异(比如鸟的羽毛颜色)。

这就导致一个尴尬的结果:AI在源领域学会了“区分大类别”,到了目标领域却连“相似物体的边界”都分不清。加上跨域带来的风格差异,双重鸿沟让现有模型的分割精度大打折扣。

二、方法创新:HSL框架的“三重buff”

为了同时解决风格差异和粒度差异,研究者提出了分层语义学习(HSL)框架,通过三个核心模块给AI装上“多维度感知能力”:

1. 双重风格随机化(DSR):给训练数据“换衣+换景”

  • 前景风格随机化:用图片中随机局部区域的风格,调整前景物体的风格,模拟目标领域中前景与背景差异小的场景,不破坏图像核心语义。

  • 全局风格随机化:通过随机卷积扰动整张图片的风格,让AI适应不同领域的视觉差异(比如从自然图到卫星图)。

  • 两者结合,让AI在训练时见过足够多的“风格变种”,减少跨域适配的难度。

2. 分层语义挖掘(HSM):让AI看懂“粗细不同的细节”

利用多尺度超像素分割(把图片分成大小不同的小区域),引导AI同时关注“粗粒度类别差异”(比如鸟 vs 背景)和“细粒度细节差异”(比如病变边缘 vs 正常皮肤)。

通过融合低-level细节特征(颜色、纹理)和高-level语义特征(类别信息),AI能自动挖掘不同粒度下的物体特征,轻松适配目标领域的分割需求。

3. 原型置信度调制阈值(PCMT):智能解决“模糊边界”

当前景和背景过于相似时,传统方法容易误判。PCMT模块会先计算AI对分割结果的“置信度”:

  • 置信度高(边界清晰):用常规阈值分割;

  • 置信度低(边界模糊):自动调整阈值,精准区分相似区域。 彻底解决了跨域场景下的分割歧义问题。

三、实验结果:四大数据集全面领先

研究者在卫星遥感图(Deepglobe)、皮肤病变图(ISIC)、胸部X光片(Chest X-ray)、自然图像(FSS-1000)四大目标领域数据集上做了测试,结果亮眼:

1. 精度碾压现有方法

  • 用ResNet-50作为骨干网络时,1-shot和5-shot设置下,比当前最优的DRA方法分别提升3.37%和3.35%;

  • 用ViT-B/16作为骨干网络时,比最优的LoEC方法分别提升3.23%和1.89%;

  • 在所有四大数据集上,均取得当前最高的mIoU(交并比)分数。

2. 效率与性能双优

相比DRA方法,HSL框架的可训练参数从59.3M降至17.2M,计算量(FLOPs)从257.0G降至226.9G,推理速度(FPS)从36.90提升至43.29,实现了“更轻量、更快、更准”。

3. 模块消融验证有效性

单独关闭任何一个模块,模型性能都会明显下降:DSR提升泛化能力,HSM增强粒度适配,PCMT解决模糊分割,三者缺一不可。

四、优势与局限

核心优势

  1. 首次聚焦“分割粒度差异”,填补了跨域少样本分割的技术空白;

  2. 无需目标领域数据微调,训练后直接部署,降低实际应用成本;

  3. 兼顾精度与效率,参数少、速度快,适合边缘设备部署;

  4. 适配多领域场景,从医学影像到卫星遥感,都能稳定发挥。

现存局限

  1. 超像素分割的尺度设置对性能有一定影响,需要根据具体场景调优;

  2. 面对极端风格差异(如抽象艺术图转医学图)时,性能提升空间有限;

  3. 低-level特征融合比例需手动设置,尚未实现完全自适应。

五、一句话总结

HSL框架通过“风格适配+粒度挖掘+智能阈值”三重创新,让AI仅靠少量源领域样本,就能精准分割不同风格、不同粒度的跨域目标,为医学影像分析、遥感图像解译等数据稀缺场景提供了高效解决方案。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/10 17:49:13

ComfyUI与TensorRT加速集成:最大化GPU利用率

ComfyUI与TensorRT加速集成:最大化GPU利用率 在如今生成式AI应用日益普及的背景下,Stable Diffusion等模型虽然赋予了创作者前所未有的视觉表达能力,但其高昂的计算成本也成了落地部署的一道门槛。尤其是在企业级内容生产、自动化设计流水线或…

作者头像 李华
网站建设 2026/8/10 16:08:00

AutoGPT支持代码执行吗?实测Python与C#脚本自动运行能力

AutoGPT支持代码执行吗?实测Python与C#脚本自动运行能力 在智能体技术快速演进的今天,一个关键问题逐渐浮出水面:AI能否真正“动手做事”,而不仅仅是“动嘴回答”?当用户提出“分析销售趋势并生成图表”这样的任务时&a…

作者头像 李华
网站建设 2026/8/10 17:49:25

基于EmotiVoice的多情感TTS系统实战:打造富有表现力的AI语音应用

基于EmotiVoice的多情感TTS系统实战:打造富有表现力的AI语音应用 在智能语音助手仍以“播报式”语调回应用户的时代,我们或许很难想象——有一天,AI能用你亲人的声音温柔地读一段睡前故事;或是在游戏中,NPC因受伤而颤抖…

作者头像 李华
网站建设 2026/8/10 17:49:25

Docker Swarm集群部署LLama-Factory生产环境最佳实践

Docker Swarm集群部署LLama-Factory生产环境最佳实践 在大模型技术加速落地的今天,越来越多企业希望基于开源LLM构建自有知识体系驱动的智能服务。然而,从模型微调到稳定部署这一链条中,往往面临开发门槛高、资源调度复杂、服务可用性差等现实…

作者头像 李华
网站建设 2026/8/11 16:21:49

AutoGPT与Neo4j图数据库整合:构建智能关系网络的知识图谱

AutoGPT与Neo4j图数据库整合:构建智能关系网络的知识图谱 在企业知识管理日益复杂的今天,一个典型的问题是:AI助手花了三天时间调研“生成式AI在制药研发中的应用”,最终交出一份详尽报告——可当一周后被问到“哪些公司正在用扩…

作者头像 李华
网站建设 2026/8/11 6:33:40

【2025最新】基于SpringBoot+Vue的福泰轴承股份有限公司进销存系统管理系统源码+MyBatis+MySQL

摘要 随着信息技术的快速发展,企业信息化管理已成为提升运营效率的重要手段。福泰轴承股份有限公司作为一家专注于轴承生产与销售的企业,传统的手工记录和Excel表格管理方式已无法满足其日益增长的订单、库存和财务数据分析需求。尤其在供应链管理环节&a…

作者头像 李华