总目录 大模型安全研究论文整理 2026年版:https://blog.csdn.net/WhiffeYF/article/details/159047894
https://arxiv.org/pdf/2404.01833
Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack
USENIX Security 2025 | LLM多轮渐进越狱为何击穿大模型安全对齐防线
📄 背景
该论文题为《Crescendo:多轮LLM越狱攻击》,作者Mark Russinovich、Ahmed Salem与Ronen Eldan,来自Microsoft Azure与Microsoft。
🚨 痛点
传统LLM越狱常把危险目标一次塞进提示词,容易被过滤;部分方法还需白盒权限。该论文发现,缺口藏在连续对话:单轮问题看似无害,模型却会追随自己生成的上下文,让安全边界逐步后退。
🛠️ 方法
该论文提出黑盒多轮攻击Crescendo:先聊抽象话题,再引用模型回复逐层加码,像音乐渐强般逼近受限任务。Crescendomation让攻击LLM生成下一问,由三类Judge评估、复核、识别拒答,碰壁即回退改写。
💡 例子:把模型想成守门员。直接要求进禁区会被拦;若先问建筑历史,再聊某层用途,请他整理提供的信息,最后只说“写成文章”,每步都像普通咨询,却沿着他铺出的路线靠近禁区。这就是“登门槛效应”:先答应小请求,更可能答应大请求。
🔍 实验发现
发现一:LLaMA-2 70B面对单独的中间请求,配合率仅36.2%;加入前置轮次后升至99.99%,完整三轮链达99.9%。若末轮写明敏感词,成功率反而低于1%,说明语境更关键。
发现二:AdvBench的50项任务中,Crescendo对GPT-4的平均ASR为56.2%,成功49项;对Gemini-Pro为82.6%,成功50项。相较四种基线,分别提升29%至61%和49%至71%。
发现三:100项HarmBench任务上,Crescendo平均ASR为63.2%,MSJ仅38.9%;至少成功一次的任务占91%,MSJ为70%。多数任务平均不到5轮即可越狱,攻击还能延伸到多模态图像生成。
🚀 总结
该论文把LLM安全从“审查一句话”推向“审视整段对话”:防御者应追踪跨轮意图,用自适应多轮数据评测与对齐。