news 2026/9/1 22:59:58

让AI学会“看人下菜碟“:CLEAR解决大模型安全与好用之间的两难

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
让AI学会“看人下菜碟“:CLEAR解决大模型安全与好用之间的两难

你有没有遇到过这种情况:问ChatGPT一个化学作业题,比如"如何让某种反应更快发生",结果它突然警惕起来,来一句"我不能提供可能有害的信息"?

这不是你的错觉。

大模型公司在给AI"上安全锁"的时候,往往面临一个尴尬的取舍。你把模型调得更安全,它拒绝回答的门槛就会降低,代价是它开始对着一些完全无害的问题也拒绝回答,专业术语叫过度拒绝。你把模型调得更好用,它变得更愿意配合各种请求,但这也意味着有人问它"怎么做炸弹"的时候,它可能真的会一五一十地教。

这个矛盾在业内有个专门的名字,叫对齐税。

安全对齐*:指通过训练让AI模型拒绝有害请求、遵守安全规范的过程,常见方法包括监督微调、人类反馈强化学习等。

来自伊利诺伊大学香槟分校和斯坦福大学的研究者们,在2026年发表了一篇论文,提出了一个思路清奇的解决方案,叫CLEAR。他们没有想着怎么在安全和好用之间找一个折中的平衡点,而是干脆让模型学会看人下菜碟:见到坏人使劲防,见到好人完全不设防。

问题到底难在哪:为什么"一刀切"的安全对齐会伤及无辜

先说清楚现有方法的痛点在哪里。

传统的安全对齐,不管是监督微调(SFT)还是标准的低秩适配(LoRA),本质上都是全局修改。

监督微调*:Supervised Fine-Tuning,一种通过给模型喂大量"问题-标准答案"样本对来调整模型行为的训练方法。

低秩适配*:LoRA,Low-Rank Adaptation,一种参数高效的微调技术,通过给模型的某些权重矩阵插入两个小矩阵的乘积来实现调整,不需要改动原始的全部参数。

这两种方法的问题在于,它们训练完之后得到的是同一套参数,不管你输入的是"如何制造炸弹"还是"如何完成化学作业",模型用的都是同一套被安全对齐"扭曲"过的行为逻辑。

论文里给出了具体数字。在Llama-3-8B-Instruct这个模型上,经过标准安全微调之后,虽然HarmBench(一个专门测试模型能不能被诱导说出有害内容的基准)的攻击成功率从32.25%降到了2%左右,看起来安全性提升很明显,但代价是GSM8K(一个小学数学应用题基准)的准确率从75.06%掉到了66.34%,足足掉了将近9个百分点。

HarmBench*:一套专门用来测试大模型是否会被诱导生成有害内容的评测基准,通过让模型回答一系列危险请求,再用另一个模型判断回答是否真的构成了有害行为。

GSM8K*:一个包含数千道小学数学应用题的评测数据集,常用来衡量模型的基础推理能力。

9个百分点的数学准确率下降意味着什么?意味着原本每答对4道题里能对3道的模型,安全对齐之后,可能连续两三道题都会算错。这不是无关痛痒的小损失,这是实打实的能力衰退。

而如果反过来,为了保住数学能力放松安全训练,攻击成功率又会飙升回32%左右,相当于三个恶意请求里就有一个能得逞。

这就是研究者面对的两难。全局修改这条路,怎么调都是拆东墙补西墙。

CLEAR的核心思路:给模型装一个"风险探测仪"

研究者的思路是,既然全局修改行不通,那就别修改全局,只在需要的时候局部修改。

具体怎么做?CLEAR冻结住原始大模型的所有参数不动,只在旁边加装两个轻量级的小模块:一个是安全适配器,另一个是风险门控。

安全适配器*:本质上是一个专门训练用来生成拒绝、引导或安全提示回答的LoRA低秩适配模块,只在被激活时才发挥作用。

门控*:Gate,一个小型神经网络,接收模型内部的隐藏状态作为输入,输出一个0到1之间的分数,代表当前输入的危险程度。

整个流程是这样的:用户输入一句话,冻结的大模型先照常处理,产生一些内部的隐藏表示(可以理解成模型对这句话"脑内理解"的一种数字化编码)。这些隐藏表示会被抽取出来,喂给那个轻量级的门控网络。门控网络输出一个分数g,范围在0到1之间。这个分数越接近1,说明这句话越危险;越接近0,说明越安全。

然后关键的一步来了:模型在做实际计算的时候,安全适配器的贡献会乘以这个分数g再加进去。数学表达是这样的:h' = Wh + g·ΔWh,其中W是模型原本冻结的权重,ΔW是安全适配器的权重更新,h是输入的激活值。

如果g接近0,相当于安全适配器几乎不起作用,模型的行为完全由原始冻结参数决定,也就是最好用、最没有被"安全对齐税"污染的那个版本。如果g接近1,安全适配器的权重被完整地叠加进去,模型的行为会明显转向拒绝和警惕。

这里有个细节容易被忽略:这个门控不是外挂的独立分类器,也不是先判断安全再判断内容的两阶段流程,它是和安全适配器一起联合训练的,直接嵌入到模型的前向计算里。

打个比方,这就像小区安保系统和传统的门卫模式的区别。传统门卫模式是不管进来的人是谁,先统一登记、统一安检、统一走一遍流程,即使你是天天见面的邻居也得走一遍。这就是全局安全对齐的做法,效率低而且体验差。CLEAR的做法更像是装了一套人脸识别加行为分析的智能安防:熟悉的邻居刷脸秒过,完全不设卡;陌生的、行为异常的人才会被拦下来细查。如果没有这套智能识别,你要么让保安对谁都严防死守搞得邻居意见很大,要么干脆撤掉安保图省事但风险陡增。CLEAR要解决的正是这个"要么严防死守,要么彻底放开"的假两难。

怎么让门控学会分辨好坏:细分类型加权与强制拉开差距

光有这个门控架构还不够,怎么训练它才是真正的技术活。

研究者用了一个叫WildJailbreak的数据集来训练,这个数据集里的提示词被分成四类:普通良性、对抗性良性、普通有害、对抗性有害。

WildJailbreak*:一个专门收集越狱攻击(试图绕过AI安全限制的手法)和对应良性提示词的训练数据集,总共包含超过26万条样本,其中安全样本约12.9万条,不安全样本约13.3万条。

这四种类型里,最容易混淆门控判断的是对抗性的那两类。对抗性有害提示往往把真实的恶意意图包装得很巧妙,表面看起来人畜无害,实际暗藏杀机;对抗性良性提示则恰好相反,看起来像是在问什么危险的东西,实际上只是无害的正常问题,比如问"历史上刺杀行动为什么会失败"这种听起来敏感但其实是正常历史提问的问题。

研究者给这两类样本加了更大的训练权重,让门控网络花更多精力去学习分辨这些容易混淆的边界案例。这个做法在论文里叫做细分类型感知的门控分类。

除此之外,光靠二分类的交叉熵损失(也就是简单地告诉模型"这个是安全的,那个是危险的")还不够,因为门控输出的是一个连续分数,如果安全和危险样本的分数分布有重叠,就会导致中间地带的输入拿到不合适的干预强度。

于是研究者又加了一个叫硬性成对间隔损失的机制。简单说,就是每次训练的时候,从同一批数据里挑出一对样本,一个安全一个危险,强制要求危险样本的门控分数必须比安全样本高出至少一个固定的间隔(论文里设为0.7)。如果这个间隔不够,就会产生额外的惩罚,逼着模型把两类样本在分数空间里进一步拉开距离。

而且这个成对损失还做了进一步的优化:对那些特别容易混淆的样本对(比如一个危险样本得分特别低、一个安全样本得分特别高的组合),会给予更大的权重,让模型优先解决这些"难啃的骨头"。

这套设计像什么呢?像老师批改考试卷子的时候,不是简单地给及格线以上打勾、以下打叉,而是要求学霸和学渣的分数必须拉开明显差距,避免出现59分和61分这种一分之差就决定生死的尴尬边界情况。如果没有这个强制拉开差距的机制,门控网络很可能学出一个"暧昧"的判断标准,大量本该被放行的良性问题因为分数刚好卡在临界点附近而被误伤,或者反过来一些真正危险的请求侥幸擦边通过。

安全适配器只在"危险时刻"训练,不去干扰良性场景

安全适配器本身的训练也有讲究,它只用WildJailbreak里的不安全提示词和对应的安全回复(比如拒绝、引导或高层次的安全建议)来训练。这意味着这个LoRA模块专精于"如何优雅地拒绝和引导",而不需要在良性场景里被迫学习任何东西。

这样设计的好处是分工明确:门控负责判断"这句话危不危险",安全适配器负责回答"如果危险,应该怎么回应"。两者各司其职,谁也不干扰谁的专业领域。

推理阶段的流程也值得说一下。当用户输入一个提示词,模型先跑一遍纯提示词的门控计算(这时候安全适配器是关闭的),得到一个分数g。这个g会在整个生成过程中保持固定,不管后面模型要生成多少个词,都用同一个g值来控制安全适配器的强度。也就是说,风险判断只在最开始做一次,不会每生成一个字就重新评估一遍,这样保证了效率。

实测效果:安全性大幅提升,好用程度基本保住

说了这么多设计思路,效果到底怎么样?

研究者在两个主力模型上做了对比实验:Llama-3-8B-Instruct和Gemma-2-2B-it。

| 模型 | 方法 | HarmBench攻击成功率↓ | 不安全拒绝率↑ | 安全过度拒绝率↓ | GSM8K↑ | MMLU↑ | TruthfulQA MC2↑ |

|---|---|---|---|---|---|---|---|

| Llama-3-8B-Instruct | 基座模型 | 32.25 | 88.50 | 2.80 | 75.06 | 66.76 | 52.47 |

| | 监督微调 | 2.00 | 94.00 | 10.80 | 66.34 | 63.86 | 48.28 |

| | 标准LoRA | 0.00 | 82.50 | 6.40 | 66.72 | 64.18 | 50.46 |

| | **CLEAR** | **0.50** | 92.50 | 4.80 | **73.46** | 63.62 | **52.63** |

| Gemma-2-2B-it | 基座模型 | 9.50 | 48.50 | 4.80 | 46.47 | 56.68 | 53.13 |

| | 监督微调 | 0.00 | 90.00 | 5.20 | 38.06 | 55.48 | 47.99 |

| | 标准LoRA | 1.00 | 88.50 | 4.40 | 38.21 | 54.52 | 47.16 |

| | **CLEAR** | 0.00 | **96.00** | 9.60 | **41.62** | 55.40 | **53.19** |

MMLU*:Massive Multitask Language Understanding,一个覆盖57个学科领域的大规模多任务语言理解测评基准,涵盖从数学到法律到医学的各种题目,常用于衡量模型的综合知识水平。

TruthfulQA*:一个专门测试模型是否会说出符合常见误解或谣言的虚假信息的评测基准,MC1和MC2是两种不同的多选题打分方式。

从这张表能看出来一个很直观的结论:CLEAR在Llama-3-8B-Instruct上把HarmBench攻击成功率从32.25%压到了0.50%,几乎是把危险请求全部拦下来了,同时GSM8K数学准确率保持在73.46%,只比基座模型的75.06%低了1.6个百分点,比监督微调的66.34%和标准LoRA的66.72%高出7个百分点还多。

在Gemma-2-2B-it上更夸张,攻击成功率直接降到0%,不安全拒绝率提升到96%,是所有方法里最高的,同时GSM8K的41.62%也是三个对齐方法里最高的,TruthfulQA MC2的53.19%甚至比基座模型的53.13%还略高一点点。

当然这里也不是完美无缺,CLEAR在安全过度拒绝率这一项上并非总是最优。比如在Gemma上,CLEAR的过度拒绝率是9.60%,比监督微调的5.20%和标准LoRA的4.40%都要高。这说明CLEAR虽然整体平衡做得更好,但并没有在每一个单项指标上都碾压对手。研究者自己在论文里也坦诚地指出,CLEAR的优势在于整体的均衡,而不是在每一个指标上都最优。

和其他安全对齐模型家族的对比

研究者还拿CLEAR去跟一些已有的、专门做过安全对齐的模型变体做了对比,包括Llama-3系列的Llama-3-8B-RR,以及Alpaca系列的SACPO、P-SACPO、Beaver-7B。

在Llama-3家族里,CLEAR把HarmBench攻击成功率从原始基座模型的32.25%压到了0.50%,而已有的经过表征工程对齐的Llama-3-8B-RR只能做到15.50%。

在Alpaca家族里,研究者把CLEAR叠加在P-SACPO这个已经做过安全偏好优化的模型之上,得到的P-SACPO+CLEAR变体把攻击成功率从22.50%进一步压到了0.50%,同时利用率指标基本维持在原有水平附近。

这个结果说明CLEAR不仅可以作为独立的安全对齐方案使用,还可以作为一个补充模块叠加在已有的安全对齐方法之上,进一步收紧安全边界。

门控本身有多轻,和外部护栏模型比一比

有意思的一点是,CLEAR内部这个负责风险判断的门控网络参数量小得惊人,只有664,129个参数,也就是六十多万参数。

相比之下,业界常用的外部护栏模型,比如Meta的PromptGuard有2.78亿参数,Llama Guard 3 8B更是有80亿参数。

护栏模型*:Guard Model,专门用来在AI系统前端或后端做安全审查的独立模型,通常需要单独加载和运行,用来判断输入或输出是否包含有害内容。

也就是说,CLEAR这个内嵌的门控比业内主流的外部护栏模型小了三到四个数量级,但在XSTest(一个专门测试模型是否存在过度拒绝倾向的基准)的路由准确性测试里,CLEAR门控依然表现出了比PromptGuard更好的判断质量。

XSTest*:一套专门设计用来检测大模型是否存在夸大安全行为(也就是对无害请求也过度拒绝)的测试集。

论文里提到一个很实际的原因:PromptGuard几乎把XSTest里所有的提示词都判定成了不安全,这不是因为PromptGuard本身设计有问题,而是因为它原本训练的目标是检测提示词注入攻击,跟CLEAR要解决的"区分真正的有害请求和表面看起来敏感但实际无害的请求"这个任务,本身就不是一回事。这就好比让一个专门抓小偷的警察去判断谁在插队,工具用错了地方,结果自然不准。

这个对比揭示了一个更深层的道理:**并不是模型越大、参数越多,就一定能把某个具体任务做得更好,任务和模型训练目标的匹配程度,往往比单纯堆参数更重要。**

换到不同大小的模型上,效果还稳吗

研究者还测试了CLEAR在不同规模模型上的表现,用的是Qwen2.5系列,从0.5B到7B参数不等。

| 模型规模 | 方法 | HarmBench攻击成功率↓ | GSM8K↑ | ROC-AUC↑ | 门控分数间隔↑ |

|---|---|---|---|---|---|

| Qwen-0.5B | 基座 | 22.50 | 31.46 | – | – |

| | CLEAR | 0.25 | 32.60 | 0.7795 | 0.0875 |

| Qwen-1.5B | 基座 | 6.25 | 51.40 | – | – |

| | CLEAR | 0.25 | 51.71 | 0.8800 | 0.0749 |

| Qwen-3B | 基座 | 15.50 | 63.23 | – | – |

| | CLEAR | 0.25 | 62.85 | 0.9155 | 0.0927 |

| Qwen-7B | 基座 | 29.00 | 82.18 | – | – |

| | CLEAR | 2.00 | 82.18 | 0.9566 | 0.2362 |

ROC-AUC*:一种衡量二分类器区分能力的常用指标,取值范围0到1,越接近1说明分类器把两类样本区分得越干净。

从这张表可以看到一个规律:模型规模越大,门控的判断质量(ROC-AUC)也越高,从0.5B模型的0.7795一路涨到7B模型的0.9566,安全危险样本之间的分数间隔也从0.0875扩大到0.2362。这说明模型规模越大,内部隐藏状态本身携带的"这句话到底危不危险"的信息量也越丰富,门控网络能更容易地从中提取出清晰的判断信号。

在Qwen-7B这个规模上,CLEAR甚至做到了GSM8K准确率完全不掉(82.18%对82.18%,一分不差),同时HarmBench攻击成功率从29.00%降到了2.00%。这说明CLEAR这套设计思路不是针对某一个特定模型量身定做的巧合,而是在不同规模的模型上都能稳定复现的一般性规律。

面对"自适应攻击",CLEAR还扛得住吗

前面说的都是常规评测下的表现,但真正狡猾的攻击者不会满足于常规手段,他们会针对模型内部的隐藏状态做定向攻击,试图在模型的"脑内表示"层面做手脚,绕过安全机制。

研究者专门设计了一个针对隐藏层表示的自适应攻击实验,用一种叫投影梯度下降(PGD)的攻击手法,在模型的嵌入层、中间层和最后一层分别注入精心计算过的扰动,试图诱导模型说出目标有害内容。

投影梯度下降*:PGD,Projected Gradient Descent,一种常见的对抗攻击优化算法,通过反复计算梯度并施加小幅扰动,逐步逼近能让模型犯错的输入。

结果显示,在三个注入层次上,标准LoRA的攻击成功率分别是54.0%、48.0%、31.0%,全量微调的攻击成功率分别是47.0%、35.0%、22.0%,而CLEAR的攻击成功率只有0.0%、7.1%、18.4%。

这个结果挺让人意外的:即便是那些在常规行为测试里表现很安全的模型(比如标准LoRA在HarmBench上的攻击成功率只有0%到1%),一旦攻击者绕过表面的对话接口,直接在隐藏表示层面动手脚,防御效果立刻现出原形,暴跌到三成到五成的攻击成功率。这说明常规的行为层面测试可能掩盖了模型深层表示上的脆弱性,就像一栋房子外墙刷得很漂亮,但内部承重结构可能早就有裂缝了。

CLEAR之所以在这个更狠的攻击场景下依然保持较低的攻击成功率,研究者给出的解释是它把安全干预限制在了风险已经被激活的表示区域里,这让攻击者想要诱导出有害的隐藏状态转移变得更困难。为了实现这个防御,研究者还专门设计了一套基于门控分数的动态投影机制:从良性提示词里提取出一个干净的隐藏状态子空间,推理时把可疑的激活值往这个干净子空间上做投影校正,而且投影的强度会根据门控分数动态调整,风险分数越高,投影拉回的力度就越大。

这就像给房子装了一套智能烟雾报警联动喷淋系统,正常情况下喷淋头关闭,一旦烟雾传感器检测到异常,浓度越高对应区域的喷淋强度就越大,而不是像传统烟雾报警器那样一刀切地要么完全不响要么全楼喷水。如果没有这种按风险等级动态调整的机制,要么是反应迟钝导致小火苗没能及时扑灭,要么是反应过度导致没着火的房间也被水浸了。

训练过程里到底发生了什么

论文附带了训练过程的可视化图表,从中可以看到几条曲线随着训练进程的变化:LoRA语言建模损失在持续下降,说明安全适配器逐渐学会了给危险提示词生成恰当的拒绝或引导性回复;门控的二分类交叉熵损失和成对间隔损失也在同步下降,说明门控网络逐渐学会了区分安全和危险样本的边界,并且把两者的分数拉开了足够的间隔。

最直观的是安全样本和危险样本各自的平均门控分数曲线:随着训练推进,危险样本的分数持续走高,安全样本的分数持续走低,两条曲线像剪刀一样越分越开。这个现象在Llama-3-8B-Instruct上尤其明显,Gemma-2-2B-it上也能观察到类似但稍微没那么剧烈的分离趋势。

消融实验揭示的细节

研究者还做了一系列消融实验,也就是拆掉某个组件看看效果会怎么变化,这类实验对于理解一个设计到底有没有用非常关键。

在门控架构选择上,他们比较了用单层隐藏状态还是用三层隐藏状态、用简单的MLP还是用更复杂的Transformer结构做门控。结果显示,用三层隐藏状态(12、16、20层)的MLP门控效果最好,HarmBench攻击成功率压到0%,GSM8K达到41.93%,比只用单层(第16层)的MLP门控(GSM8K只有34.42%)明显更好。有意思的是,更复杂的Transformer门控架构并没有比简单的MLP门控更优,这说明在这个具体任务上,多用几层隐藏状态信息比堆砌更复杂的网络结构更有效。

在训练目标的消融实验里,研究者对比了只用二分类交叉熵损失(不加成对间隔损失)和完整版CLEAR目标。结果显示只用交叉熵损失的版本,HarmBench攻击成功率从0.00%回升到了3.25%,不安全拒绝率从96.00%掉到83.50%,安全过度拒绝率反而飙升到14.40%。这个结果非常直接地证明了前面提到的那个成对间隔损失机制不是可有可无的装饰,而是真正在起作用的核心组件:如果没有它,门控学出来的判断边界会比较模糊,导致大量误判。

训练和部署成本:值不值得多花这份心思

有人可能会问,多加一个门控网络,会不会让训练和部署变得特别麻烦?

论文里的成本对比表给出了答案。在Llama-3-8B-Instruct上,全量微调需要训练80.3亿个参数,耗时5小时8分14秒,占用内存920亿字节左右;标准LoRA只需要训练341万个参数,耗时3小时18分25秒;而CLEAR需要训练551万个参数,耗时5小时8分55秒,内存占用405亿字节。

可以看到,CLEAR相比标准LoRA确实多了一些训练时间和参数量的开销,因为它多了一个门控网络需要训练,但相比全量微调,CLEAR依然节省了三个数量级的可训练参数量,训练时间也明显更短。这笔账算下来,多花的这点成本,换来的是明显更优的安全性和利用率平衡,性价比是划算的。

这个思路能给我们带来什么启发

CLEAR这套框架背后其实藏着一个更普遍的道理:很多"安全性和好用性不可兼得"的困境,本质上并不是真正的物理定律级别的矛盾,而是因为解决方案的设计颗粒度太粗。

如果把安全对齐这件事想象成给整个城市装摄像头监控,传统做法相当于每条街道装一样密度的摄像头,不管这条街是治安热点还是安静住宅区。而CLEAR的思路更像是先做风险评估,摸清楚哪些区域容易出事,然后把更多的监控资源和巡逻力量投放到高风险区域,安静的居民区反而保持基本不受打扰的状态。这种精细化的风险分级配置思路,其实在很多领域都有类似的应用,比如网络安全里的入侵检测系统,医疗领域的分级诊疗制度,本质上都是同一种思路:不要用统一的最高标准去处理所有情况,而要先判断风险等级,再匹配相应强度的干预措施。

当然,这个思路也有它天然的软肋,那就是极度依赖风险判断这一步的准确性。论文的作者自己也在文章末尾坦诚承认了这一点,如果门控判断失误,把一个真正危险的请求误判成安全的,那么安全适配器根本不会被激活,危险内容就会直接被生成出来。反过来,如果把良性请求误判成危险,那用户又会遇到不必要的过度拒绝。所以这套系统的可靠性上限,很大程度上取决于门控网络本身训练得够不够好,遇到没见过的新型攻击手法时能不能依然保持准确的判断。

写在后面

读完这篇论文,最让我意外的一点其实是那个自适应攻击的实验结果。标准LoRA在常规的HarmBench测试里几乎表现完美,攻击成功率能压到0%到1%,但一旦攻击者换个思路,直接从隐藏层表示下手,攻击成功率立刻能飙到54%。这个巨大的落差提醒我们,很多AI安全评测可能存在一个共同的盲区:我们习惯性地只测试模型对着"正常输入接口"的反应,却很少去戳一戳模型内部表示层面到底稳不稳固。这就好比给一栋楼做安检,只检查了正门和窗户有没有锁好,却没人想过要去检查地基里有没有裂缝。

另一个细节值得单独说一说:门控网络只有66万参数,比动辄几亿甚至几十亿参数的外部护栏模型小得多,但效果反而更贴合任务。这说明在安全对齐这件事上,参数规模从来不是决定性因素,训练目标和实际任务是否精准匹配才是。这个道理其实超出了AI安全的范畴,放在很多工程决策里都成立:大而全的通用工具,未必比小而专的定制工具更好用。

这套框架目前还只在相对较小的开源模型上验证过,能不能推广到更大规模的前沿模型甚至多模态系统,论文里没给出答案。如果风险判断这一环节可以做得更稳健,会不会有一天,我们不再需要在"安全"和"好用"之间做二选一的痛苦决定?

Q&A

Q1:CLEAR是什么?

A:CLEAR是由伊利诺伊大学香槟分校和斯坦福大学研究者提出的一种大模型安全对齐框架,核心思路是给模型加装一个轻量级的风险判断门控,根据输入内容的危险程度动态调整安全适配器的干预强度,从而在提升安全性的同时尽量不损害模型对良性请求的处理能力。

Q2:CLEAR和普通的安全微调有什么区别?

A:普通的监督微调或标准LoRA是对模型做全局统一的修改,不管输入是危险还是安全,都用同一套被修改过的参数处理。CLEAR则冻结原始模型参数不动,只在检测到风险时才激活一个专门的安全适配器,安全的请求会尽量保持接近原始模型的表现。

Q3:CLEAR的效果具体好在哪里?

A:在Llama-3-8B-Instruct上,CLEAR把HarmBench攻击成功率从32.25%降到0.50%,同时GSM8K数学准确率保持在73.46%,比监督微调和标准LoRA高出约7个百分点。在应对针对隐藏层表示的自适应攻击时,CLEAR的攻击成功率也明显低于标准LoRA和全量微调。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 22:56:09

基于ReasonixGUI的DeepSeek Harness客户端:从思路到落地

【ReasonCode】基于ReasonixGUI的DeepSeek Harness客户端:从思路到落地最近在做 AI 工具链的桌面端封装时,DeepSeek Harness 这个词频繁出现在我的视野里。它并不是某一个单一的软件,而是围绕 DeepSeek 模型能力形成的一套“工具链 编排层”…

作者头像 李华
网站建设 2026/9/1 22:55:56

Flask+Vue医院预约挂号系统实战:核心架构与源码解析

简介:本资源是一套完整的基于Python Flask与Vue.js的医院预约挂号系统开发实践材料,面向Web全栈初学者及医疗信息化项目开发者,旨在解决传统挂号流程效率低、信息不透明等痛点。压缩包共604个文件,含118个Vue组件文件支撑前端交互…

作者头像 李华
网站建设 2026/9/1 22:54:13

Excel批量转换数字符号:从基础公式到VBA宏的完整指南

在实际数据处理工作中,我们经常遇到需要批量修改Excel数据符号的场景。例如,财务人员需要将一列收入数据从正数转为负数以便进行支出统计,或者开发人员在处理从外部系统导入的数据时,需要为特定列的所有数值统一添加负号。手动逐个…

作者头像 李华
网站建设 2026/9/1 22:51:08

运放电路失真排查指南:从削波、交越失真到自激振荡

运放电路的常见失真,在实验室里往往比仿真更难定位。明明是同一颗运放、同样的放大倍数,仿真里输出是一个干净正弦波,实际用示波器一看,却可能出现削波、不对称、过零台阶、边缘振铃,甚至毫无规律的高频振荡。更麻烦的…

作者头像 李华
网站建设 2026/9/1 22:51:01

超声波焊接塑胶件双工位气密检测:提效原理与产线落地指南

超声波焊接的塑胶件,焊完之后为什么要再过一道气密检测?因为焊缝里可能有微裂纹、气孔、虚焊,肉眼根本看不出来。汽车传感器、新能源三电部件、医疗器械、消费电子防水壳,这些产品一旦漏气,轻则功能失效,重…

作者头像 李华
网站建设 2026/9/1 22:48:05

AI智能体记忆系统脆弱性分析:从灾难性遗忘到检索失效的工程加固

在实际 AI 系统开发中,构建能够持续学习和自我改进的智能体是一个前沿且充满挑战的目标。这类智能体通常依赖一个不断更新的记忆系统来存储经验、知识和策略,从而实现能力的迭代提升。然而,这个记忆系统并非坚不可摧,其脆弱性——…

作者头像 李华