news 2026/8/25 14:20:35

无偏教师 v2:适用于无锚框和基于锚框检测器的半监督目标检测

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
无偏教师 v2:适用于无锚框和基于锚框检测器的半监督目标检测

一、论文信息

  1. 论文题目:Unbiased Teacher v2: Semi-supervised Object Detection for Anchor-free and Anchor-based Detectors
  2. 论文作者:Yen-Cheng Liu, Chih-Yao Ma, Zsolt Kira
  3. 发表单位:Georgia Institute of Technology, Meta
  4. 发表期刊:CVPR2022

二、研究背景

  1. 缺少针对无锚框检测器的半监督目标检测方案:现有半监督目标检测相关研究主要聚焦于基于锚框的检测器,直接迁移到无锚框检测器,性能提升很差。根源是半监督场景下,中心度得分不可靠、基于定位的标签分配对伪标签中的定位噪声缺乏鲁棒性。
  2. 伪标签做边界框回归效果差:传统教师-学生框架依靠置信度阈值筛选伪框做回归损失。
  • 单一分数无法表达框四条边界各自的定位质量;
  • 分类置信度不能准确反映边界回归预测质量;
  • 仅依靠教师置信度来选择伪标签,无法过滤会误导回归训练的错误样本。

三、本文创新点

  1. 探究无锚框检测器半监督问题:首次实证研究半监督方法在无锚框检测器上的表现,识别出中心度、标签分配带来的核心问题,实现半监督方法在无锚框、基于锚框两类检测器上通用。
  2. 提出用于无监督回归损失的聆听学生Listen2Student机制:新增边界定位不确定性分支,对比师生模型的相对不确定性,有助于在半监督设计下对回归分支实现正向改进。
  3. Unbiased Teacher v2 通用半监督检测框架:一套框架同时兼容锚框、无锚框检测器,弥补了半监督场景下两种检测器的性能差距。

四、具体方法

4.1 背景

  1. Ds={xis,yis}i=1Ns D_s=\{x_i^s,y_i^s\}_{i=1}^{N_s}Ds={xis,yis}i=1Ns
    代表有标签数据集,包含图像与对应的真实标注,一共NsN_sNs
  2. Du={xiu}i=1Nu D_u=\{x_i^u\}_{i=1}^{N_u}Du={xiu}i=1Nu
    代表无标签数据集,仅有图像X_i,没有人工标注,一共NuN_uNu

现有研究包含两个阶段:预热阶段和相互学习阶段。
3. 监督损失,在有标签数据集上计算
Lsup=∑iL(xis,yis). L_{sup}=\sum_{i} L(x_i^s,y_i^s).Lsup=iL(xis,yis).
遍历所有有标签样本,对单张有标签图像的检测损失求和。L内部就是检测器原生损失,包括分类损失+边框回归损失
4. 无监督损失,在无标注数据集上计算
Lunsup=∑iL(xiu,y^iu). L_{unsup}=\sum_{i} L(x_i^u,\hat{y}_i^u).Lunsup=iL(xiu,y^iu).
L(.):检测器损失函数(分类+回归)

4.2 无锚框检测器上的伪标签学习

  1. FCOS模型包含三个主要预测分支:
  • 用于执行目标类别分类的分类器
  • 用于指示成为前景目标中心概率的中心性分支
  • 用于估计到目标边界距离的回归器

    发现:半监督目标检测中,无锚框检测器收益远不如锚框检测器
    全监督条件下:无锚框检测效果更好;但是半监督条件下,这几个方法均有明显下降。

    把UT适配到无锚框模型:直接迁移后性能下降
    F-RCNN:有锚框
    FCOS:无锚框
    全监督情况下,无锚框能力略好于有锚框;标注比例越少,无锚框的mAP明显下降。说明传统伪标签方案在无锚框检测器上存在缺陷。
  1. 中心偏差度问题

    FCOS打分逻辑:Box Score=分类得分*中心度
    中心度:无锚框特有,衡量采样点距离物体真实框中心有多远,0~1,用于惩罚定位不准的预测

    训练迭代-mAP曲线
    红色:FCOS做法;
    蓝色:只用分类得分筛选伪标签。
    说明中心度在半监督场景起到负面作用。

    迭代次数-平均分数曲线
    中心度:持续增大
    分类得分:随着迭代次数增多,分类得分反而逐步下降
    Box-Score:缓慢下降
    说明:中心度分支由于无标注数据,输出值普遍很高;但是分类分支在下降,最终很多分类很差的框,由于中心度很大,最终也会被选为伪标签,导致低质量伪标签持续输入训练,也造成了(a)图后期的下降。
  2. 不可靠的标签分配
    为提升全监督无锚框检测器的性能,有两类高级标签分配策略:
  • 基于边界框定位加权的软分类标签,这类标签会根据边界框的定位情况进行加权
  • FCOS的center-sampling中心采样:只把距离物体中心足够近的像素记为前景,框边缘像素视为背景,在全监督场景下效果很好

    Pseudo‑box 伪标签框,伪标签框本身已经偏移,存在定位噪声
    • Pseudo‑box伪标签框整体偏移,算法直接把背景标记为前景,精确率、召回率均为零
    • Localization‑based Class. Label(基于定位的软标签)距离伪框中心越近,前景权重越高,算法将权重最高区域落在了背景,只有极少像素在真实物体上
    • Standard(基础标准分配)把整个伪框内全部像素标记为前景,不做筛选,此方法精确率召回率均高于另两种策略
    • 原因:中心采样过分依赖框的中心准确度,伪框中心一旦不准,就会有大量标签分配出现问题
  1. 解决方法
  • 只使用分类得分筛选伪框,舍弃中心度分数
  • 分类器使用硬标签进行训练,不再使用依靠框定位加权得到的软标签
  • 使用标准标签分配策略
  1. 依旧没有解决伪框存在定位噪声的问题,所以又提出了聆听学生板块

4.3 用于无监督回归损失的Listen2Student

4.3.1 回归任务中置信度阈值化的局限性

置信度阈值筛选伪框在回归任务中依旧存在固有局限。虽然置信度阈值在分类任务中表现良好,但无法有效过滤框回归中的误导性样本,原因有:

  • 常规检测器的回归分支只输出边界坐标,没有预测定位不确定性;分类置信度无法反映框定位质量
  • 单一分数(中心度/交并比分数)难以同时表示四个边界各自的预测质量
  • 回归输出为无界连续数值,高置信度的教师模型依然可能输出误导性样本
4.3.2聆听学生板块

  1. 理想情况下的定义(有真实GT时)
    d~t\tilde{d}_td~t:教师回归预测
    dgd_gdg:真实回归标签(GT)
    d~s\tilde{d}_sd~s:学生回归预测
  • 有益样本:∥d~t−dg∥≤∥d~s−dg∥\|\tilde{d}_t-d_g\| \le \|\tilde{d}_s-d_g\|d~tdgd~sdg
    教师预测比学生更准:用教师结果监督学生
  • 误导样本:∥d~t−dg∥>∥d~s−dg∥\|\tilde{d}_t-d_g\| > \|\tilde{d}_s-d_g\|d~tdg>d~sdg
    学生预测更准:不使用教师生成的伪标签
  • 但是半监督无标签数据没有真实标签,所以新增分支定位不确定性分支,用不确定性近似预测和GT的误差
  1. 定位不确定性分支
    把边界回归看成高斯分布:
    p(d∣x)=N(d; d^, δ2)p(d|x) = \mathcal{N}(d;\ \hat{d},\ \delta^2)p(dx)=N(d;d^,δ2)
    d^\ \hat{d}d^:回归分支预测的边界距离(均值)
    δ\ \deltaδ:不确定性分支输出的标准差,越大说明模型对这个边界预测越没把握
  • 有监督损失:NPLL负幂对数似然损失
    Lregsup=∑iηi(∑((ds−dg)22δs2+12log⁡δs2)+2log⁡2π)\mathcal{L}_{reg}^{sup} = \sum_{i} \eta_i\left(\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}+\frac12\log\delta_s^2\right)+2\log2\pi\right)Lregsup=iηi((2δs2(dsdg)2+21logδs2)+2log2π)

    • dgd_gdg:GT真实边界距离
    • dsd_sds:学生网络回归分支预测边界距离
    • δs\delta_sδs:学生不确定性分支输出的不确定性(标准差)
    • ηi\eta_iηi:预测框和真值框的交并比权重;交并比越高,该样本损失权重越大
    • ∑((ds−dg)22δs2)\sum\left(\frac{(d_s-d_g)^2}{2\delta_s^2}\right)(2δs2(dsdg)2):回归误差项,如果预测错了,不确定性要变大,以承担误差
    • 12log⁡δs2\frac12\log\delta_s^221logδs2:正则项,防止不确定性无限变大
  • 无监督回归损失:利用师生不确定性做伪标签筛选
    Lregunsup={∑i∥d~ti−d~si∥,if δti+σ≤δsi0,otherwise\mathcal{L}_{reg}^{unsup}= \begin{cases} \sum_i \|\tilde{d}_t^i-\tilde{d}_s^i\|, & \text{if } \delta_t^i+\sigma \le \delta_s^i \\ 0, & \text{otherwise} \end{cases}Lregunsup={id~tid~si,0,ifδti+σδsiotherwise
    训练阶段:只有在教师不确定性显著小于学生时,才添加无监督回归损失
    推理阶段:直接丢弃不确定性分支,只保留回归分支

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/25 14:19:49

Agent 敢开写权限吗?—— 深入探讨 AI 代理的自主操作风险与安全边界

一、 引言:当 AI 获得“手”与“笔”随着 AI Agent(智能代理)能力的飞速发展,其已从单纯的“思考者”演变为能够调用工具、执行任务的“行动者”。一个核心且敏感的问题随之浮现:我们敢赋予 Agent 直接修改文件、写入数…

作者头像 李华
网站建设 2026/8/25 14:19:46

C++初阶——类和对象(下)

目录 一 再探构造函数 二 类型转换 三 static成员 四 友元 五 内部类 六 匿名对象 七 对象拷贝时的编译优化 一、再探构造函数之前实现构造函数时,初始化成员变量主要使用函数体内赋值,构造函数初始化还有一种方法,就是初始化列表每个…

作者头像 李华
网站建设 2026/8/25 14:16:46

AI 编程不得不知道的二三事

一句话记忆:模型是「大脑」,IDE/终端 Agent 是「手脚」,范式是「怎么用它」,MCP 等协议是「接口标准」,Coze/Dify 是「搭积木的台子」。 以下内容仅为一家之言,旨在统计AI相关的东西,目前以202…

作者头像 李华
网站建设 2026/8/25 14:11:12

隐匿中的生长:当代青年 “偷感” 现象解读

青年"偷感"现象:心态表征、生成机理与深层解读 一、现象:当"偷感"成为一种集体标签 “偷感"是近年来在青年群体中迅速蔓延的一个网络热词。微博话题 #偷感很重是什么梗# 的阅读量超过 7800 万,抖音 #偷感# 的播放…

作者头像 李华
网站建设 2026/8/25 14:09:32

2021CSP-J初赛真题解析(适合复习、巩固、备考)

【第一部分 选择题】 1.以下不属于面向对象程序设计语言的是( )。 A. C B. Python C. Java D. C 【解析】D。 C语言是一种面向过程的结构化程序设计语言。 2.以下奖项与计算机领域最相关的是( )。 A. 奥斯卡奖 B. 图灵奖 C. 诺贝尔…

作者头像 李华
网站建设 2026/8/25 14:08:59

麒麟(Kylin)服务器系统网卡地址设置

1.系统版本查看cat /etc/.productinfo或者cat /etc/.kylinfo或者cat /etc/kylin-release或cat /etc/os-release2.系统内核查看uname -a3.网卡桌面方式配置4.网卡命令行方式配置默认为dhcp获取方式cat /etc/sysconfig/network-scripts/ifcfg-enp4s0命令行配置vi /etc/sysconfi…

作者头像 李华