A Red Teaming Framework for Evaluating Robustness of AI-enabled Security Orchestration, Automation, and Response Systems
论文重点
本文提出了一种将大语言模型(LLM)与强化学习(RL)相结合的分层红队框架,用于评估AI驱动的安全编排、自动化与响应(SOAR)系统在面对自适应多阶段攻击时的鲁棒性。研究发现,独立LLM智能体无法维持长期攻击活动,而领域特定网络安全模型仅能达到有限渗透水平,混合LLM-RL方法在红队测试中展现出显著优势。
核心研究内容
问题定义
随着AI赋能SOAR系统在企业网络安全防御中的日益普及,这些系统尚未针对自适应、战略性的对手进行严格压力测试。传统的渗透测试和基于规则的红队脚本无法捕捉真实世界攻击的动态、多阶段特性。核心挑战在于:如何系统性地评估AI驱动的自主防御系统在面对能够持续演化攻击策略的对手时的鲁棒性?
关键矛盾在于:LLM具备强大的战略推理和领域知识,但缺乏通过环境交互学习的能力;RL智能体能够通过试错学习优化策略,但面临样本效率低、可解释性差和在异构环境中泛化能力弱的问题。两者各自独立应用时均存在根本性局限。
创新方法
分层LLM-RL混合架构是本文最核心的创新点:
战略规划层(LLM):LLM作为高层规划器,以较粗的时间粒度运行,根据当前观测生成结构化的“意图”对象,编码攻击类型、MITRE ATT&CK战术、目标选择和风险姿态等高层决策。LLM参数在训练过程中保持固定,以保留外部知识。
战术执行层(RL):RL控制器在每个时间步执行底层动作,决策受当前观测和LLM生成的意图共同影响。采用PPO(Proximal Policy Optimization)算法进行策略优化。
杀伤链对齐的奖励塑形:设计了包含环境奖励、进度奖励、约束惩罚和意图对齐奖励的多组分奖励函数:
rt=renv+rprogress+rconstraint+ralignmentr_t = r_{\text{env}} + r_{\text{progress}} + r_{\text{constraint}} + r_{\text{alignment}}rt=renv+rprogress+rconstraint+ralignment
奖励设计覆盖了从主机发现(+0.2)到首次攻陷受保护子网(+8.0)的完整杀伤链里程碑。
- Reflexion记忆机制:规划器在每回合结束时生成自然语言的自我反思,存储在FIFO缓冲区中,在后续回合作为规划输入,实现无需参数更新的跨回合战略调整。
研究成果
论文在CybORG CAGE Challenge 4环境中进行了系统评估:
评估环境:CAGE 4是多子网企业网络仿真,包含五个由H-MARL专家策略协调的蓝队防御者——这是该环境下已发表的最强自主防御策略。每回合长达500个时间步,具有部分可观测性和自适应防御响应。
基线对比:
- LLM-only(零样本):评估了14个开源LLM,涵盖Qwen3(0.6B-32B)、Llama(8B-70B)、推理专用模型(DeepSeek-R1-14B、QwQ-32B)和领域专用模型(Foundation-Sec-8B、DeepHat-7B、RedSage-8B)
- RL-only:无LLM引导的PPO控制器
核心发现:
- 独立LLM智能体无法维持多阶段攻击活动
- 领域特定网络安全模型仅能达到有限的渗透水平
- 混合LLM-RL方法在攻击行动计数(AAC)、回合渗透率(ECR)和主机发现(AHD)等指标上均优于纯LLM和纯RL基线
实际落地应用的可能性
落地可行性:中等偏高
有利因素:
- 基于开源工具链(CybORG、PPO、主流LLM),技术栈成熟
- 作者团队具备军方和学术双重背景(下文详述),研究可信度高
- 分层架构设计考虑了计算效率(规划器每20步触发一次,非每步运行)
挑战与局限:
- 当前仅在仿真环境(CAGE 4)中验证,尚未在真实企业网络中测试
- 论文未公开代码和模型权重,可复现性存疑
- RL训练需长达48小时/次,计算资源要求较高
- 从仿真到真实环境的迁移(sim-to-real)是核心挑战——真实网络的攻击面、防御响应和不确定性远超仿真
技术细节
状态与意图表示
观测被转换为两种互补表示:
- LLM规划器:结构化的自然语言摘要(≤600 tokens)
- RL控制器:445维数值特征向量
LLM输出的结构化意图经编码器映射为128维嵌入,与观测的128维嵌入拼接为256维输入,供策略网络和价值网络使用。
动作空间
10个离散动作,与MITRE ATT&CK战术对齐:
| 动作 | MITRE ATT&CK战术 |
|---|---|
| DiscoverRemoteSystems | 侦察 |
| AggressiveServiceDiscovery | 侦察 |
| StealthServiceDiscovery | 侦察 |
| DiscoverDeception | 侦察 |
| ExploitRemoteService | 初始访问 |
| PrivilegeEscalate | 权限提升 |
| Impact | 影响 |
| DegradeServices | 影响 |
| Withdraw | 防御规避 |
| Sleep | 防御规避 |
PPO超参数
| 参数 | 值 |
|---|---|
| 学习率 | 3×10⁻⁴ → 3×10⁻⁵(线性衰减) |
| Clip比ε | 0.2 |
| 折扣因子γ | 0.99 |
| GAE参数λ | 0.95 |
| Mini-batch大小 | 64 |
| PPO轮数/rollout | 8 |
| 回合数/rollout | 10 |
| 最大梯度范数 | 0.5 |
| 熵系数 | 0.05(Qwen3)/ 0.10(Foundation-Sec-8B) |
研究设定
硬件/软件配置
仿真环境:
- CybORG CAGE Challenge 4
- 企业网络:多子网、多主机、多服务
- 蓝队:5个H-MARL协调的AI防御者
- 每回合:最多500个时间步
- 部分可观测性
模型配置:
- LLM规划器:14个开源模型,参数规模0.6B-70B
- RL控制器:PPO with GAE
- 规划频率:每20步或动作失败时触发
- 训练时长:最长48小时/次,最少20,000回合
评估指标:
- ECR(Episode Compromise Rate):至少实现一次主机攻陷的回合比例
- AAC(Attack Action Count):攻击行动总数
- AHD(Average Host Discovery):平均主机发现数量
综合分析
作者团队背景分析
Ankit Shah(通讯作者):印第安纳大学凯莱商学院运营与决策技术助理教授,凯莱商学院数据科学与人工智能实验室网络安全副主任。研究方向聚焦于AI驱动的组织网络安全。学术背景扎实,兼具商学院(战略视角)和计算机科学(技术视角)的交叉优势。
Nathaniel D. Bastian:美国西点军校电气工程与计算机科学系教授,美国陆军中校,机器人研究中心副主任,人工智能研究与工程实验室首席研究员。曾获得DARPA资助进行神经符号人工智能研究。军方背景意味着其对网络攻防的实际需求有深刻理解。
Ayan Javeed Shaikh:印第安纳大学博士生。
团队评估:这是一个“学术+军方”的复合型团队。军方背景确保了研究问题与真实防御需求的紧密关联;学术背景确保了方法论的系统性和严谨性。作者团队并非纯粹的“理论派”,而是具备将研究成果转化为实际工具的能力和渠道。
技术真实性评估
理论层面:扎实。LLM-RL混合架构在机器人、游戏AI等领域已有成功先例,将其迁移到网络安全红队场景是合理的学术延伸。Reflexion机制、杀伤链对齐奖励等设计均有理论支撑。
实证层面:可靠。在CAGE 4这一公认的自主网络智能体标准基准上进行评估,基线对比全面(14个LLM × 多参数规模),实验设计严谨。
潜在问题:
- 缺少消融实验的完整细节:论文虽提及了三组实验轴(语言模型选择、记忆增强、LLM-RL集成),但具体量化数据在公开版本中呈现有限
- 缺少与人类红队专家的对比:这是评估“自主红队”能力的黄金标准,论文未涉及
- 缺少真实SOAR系统的测试:当前仅在仿真中验证,与真实AI-SOAR系统的差距未知
可行性评估
短期(1-2年):可在安全研究实验室和大型企业安全团队中作为红队辅助工具试用。架构基于开源组件,复现成本可控。
中期(2-5年):若代码开源并经过真实环境验证,有望集成到商业红队平台中。军方背景的作者团队可能率先在国防领域应用。
长期(5年以上):可能演变为持续红队测试的标准方法论,与AI-SOAR系统形成“攻防对抗”的闭环评估体系。
实践应用建议
对安全研究人员的建议
复现研究:建议在CAGE 4环境中复现论文实验,验证其结论的可重复性。可重点关注LLM规划器的意图生成质量和RL控制器的策略收敛速度。
扩展到其他环境:尝试将框架迁移到其他网络仿真环境(如CyberBattleSim、FARLAND),测试其泛化能力。
开源贡献:论文目前未公开代码,社区可考虑自行实现开源版本,推动该方向的发展。
对企业的建议
红队能力建设:大型企业可参考该分层架构,构建内部自主红队能力,用于持续评估AI-SOAR系统的防御有效性。
关注仿真到真实的鸿沟:在采用类似技术前,需充分评估仿真环境与企业真实网络环境的差异,特别是防御响应的不可预测性和攻击面的复杂性。
人机协作模式:当前框架虽可实现一定程度自主红队,但仍建议采用“AI辅助+人类决策”的模式,由框架生成攻击策略建议,由安全专家进行最终决策。
对SOAR厂商的建议
防御评估服务:可将此框架集成到产品中,为客户提供“红队即服务”,持续验证SOAR系统的鲁棒性。
对抗训练:利用框架生成的攻击数据对SOAR系统进行对抗训练,提升其应对未知攻击的能力。
参考资料来源
- 原始论文: https://arxiv.org/html/2605.17075v1
- arXiv摘要: https://arxiv.org/abs/2605.17075