news 2026/10/7 17:24:35

HERA:面向智能体主动拒止能力的执行框架‑环境协同演化框架

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
HERA:面向智能体主动拒止能力的执行框架‑环境协同演化框架

HERA:面向智能体主动拒止能力的执行框架‑环境协同演化框架

原文网页:https://arxiv.org/html/2610.06563v1
PDF链接:https://arxiv.org/pdf/2610.06563v1
arXiv编号:arXiv:2610.06563v1 [cs.AI]

摘要
大语言模型工具智能体已经可以完成复杂多步交互任务,但经常无法识别任务不可行、不存在有效解的场景,仍然继续盲目执行。近期研究将该可靠性缺口定义为智能体主动拒止(agentic abstention)问题。现有方案大多针对固定任务集优化模型或者智能体执行框架,在未见过的失效模式上泛化能力有限。
本文提出
HERA
,面向智能体主动拒止任务的执行框架‑环境协同演化框架。HERA包含两大核心模块:(1)环境变异流水线,通过受控环境变异操作,自动构造可验证的成对任务样本:可行任务(存在解)与不可行任务(应当触发拒止);(2)协同演化流程,利用上一轮任务执行暴露的失败案例,同时驱动智能体执行框架(Harness)适配更新,并且生成新的、针对当前弱点的执行环境与任务。
在留出评测任务集上,经过HERA演化得到的执行框架,将拒止成功率从61.7%提升至83.3%,同时可行任务完成率由68.3%提升至76.7%,在全部对比方法中同时取得最优拒止能力与可行任务完成能力。将这套演化后的执行框架直接迁移到另外19个大模型,无需针对每个模型做专项优化,拒止准确率平均提升15.3个百分点;让成本更低的小模型可以达到高价大模型的性能,预估API开销降低85%。

关键词
大模型智能体;智能体主动拒止;协同演化;执行框架Harness;环境变异;工具使用;评测基准

目录

  1. 引言
  2. 相关工作
  3. 方法:执行框架‑环境协同演化
    • 3.1 可验证拒止任务‑环境对的构建
    • 3.2 执行框架‑环境协同演化完整流程
  4. 实验设置
  5. 实验结果
    • 5.1 基准对比
    • 5.2 协同演化动态过程
    • 5.3 跨模型迁移能力
    • 5.4 性能‑成本权衡分析
  6. 结论
  7. 附录简要说明

1 引言

大语言模型智能体依靠多轮工具交互完成复杂任务,但存在显著可靠性缺陷:当任务条件缺失、环境不具备执行前提时,智能体无法识别应当停止,依旧持续调用工具执行。这种识别到条件不足主动停止的能力被称为智能体主动拒止。
盲目继续执行会带来多重危害:任务结果恶化、产生不必要API开销与延迟,甚至触发不可逆的危险操作。

现有提升智能体可靠性分为两条路线:

  1. 模型侧优化:监督微调、强化学习、在线策略优化;直接修改基座模型权重。
  2. 执行框架Harness优化:固定基座模型,优化外层调度逻辑,包含提示词、记忆、子智能体、工具调用、动作校验、继续/恢复/停止控制逻辑。

相比模型微调,执行框架优化在智能体拒止方向的研究还比较少。针对固定任务集做框架优化只能暴露有限种类失败;当框架适配现有样例后,原有任务很难再暴露出新的弱点,需要同步演化任务分布,生成新的挑战性案例。

本文提出HERA框架,实现执行框架与环境任务协同演化:

  1. 第一阶段:环境变异流水线,基于可求解的原始任务,通过受控环境变异生成成对样本:同一任务指令,一份环境可行,另一份经过变异后不可行,需要智能体触发拒止。
  2. 第二阶段协同演化:分析上一轮执行轨迹中的失败,一方面更新智能体执行框架,另一方面针对性生成新环境与任务,专门暴露当前版本智能体的薄弱点;两者互相驱动迭代。

基于HERA构建HERA‑BENCH评测基准,包含60对可验证的可行‑不可行任务对。
主实验使用GPT‑5.6‑Luna作为基础执行模型;将演化完成的执行框架直接迁移到其余19个闭源、开源模型,不做任何模型专属调优,依然获得显著性能增益。

本文主要贡献

  1. 任务构建流水线:受控环境变异,自动生成可验证的可行‑不可行成对工具交互任务,由此构建HERA‑BENCH基准。
  2. 执行框架‑环境协同演化范式:利用执行失败同时驱动框架更新、新挑战任务生成;在训练集上拒止成功率86.0%,成对综合成功率78.0%,优于全部基线。
  3. 强可迁移的执行框架改进:演化得到的框架可以直接跨19个LL(\mathcal M)生效,拒止指标平均提升15.3pp,无需各模型专项适配。
  4. 性能‑成本分析:使用演化后的框架,低成本模型可以逼近高价大模型效果,实现显著的API开销下降。

2 相关工作

2.1 智能体主动拒止

普通LL(\mathcal M)拒止:模型在信息不足、知识缺失、安全风险场景拒绝回答。
智能体层面的拒止更进一步:多步工具交互环境下,智能体需要判断什么时候应当停止行动。
已有工作大多使用固定环境或者独立生成任务,不会利用智能体运行失败反馈反过来生成新挑战环境。HERA核心创新:框架、环境任务两者协同迭代演化。

2.2 智能体执行框架Harness演化

现有(\mathcal M)eta‑Harness、Agentic Harness Engineering、AEVO等工作,在固定环境集合之上优化外层框架组件(提示词、工具、记忆、子智能体、控制逻辑)。
HERA区别:不只优化框架,同时演化环境与任务分布;新生成任务专门针对当前框架暴露的弱点,应用于智能体拒止问题。

3 方法:执行框架‑环境协同演化

整体分为两大阶段:①可验证可行‑不可行任务‑环境对构建;②执行框架‑环境协同演化闭环。

3.1 可验证拒止任务‑环境对的构建

流水线包含三步:环境构建 → 任务生成 →环境变异

  1. 环境构建:选定业务语义主题,使用研究智能体构建结构化数据库,生成配套可执行工具集;校验工具合法性,输出原始可执行环境E θ \mathcal{E}_\thetaEθ​。
  2. 任务生成:任务生成器基于环境生成候选任务;使用独立求解器尝试执行,只保留可以成功完成的任务Q θ Q_\thetaQθ​,同时保存参考执行轨迹。
  3. 环境变异:对( E θ , Q θ ) (\mathcal{E}_\theta,Q_\theta)(Eθ​,Qθ​)生成多条变异提案;使用两套校验策略:
    • π s e m \pi_{sem}πsem​语义策略:变异后环境语义保持和原主题一致;
    • π r e s \pi_{res}πres​救援校验策略:确认变异之后不存在其它隐藏路径可以完成原任务。
      经过校验的变异算子KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal \̲(̲\mathcal M\)作用于原始环境:
      KaTeX parse error: Can't use function '\(' in math mode at position 31: …heta'=\mathcal{\̲(̲\mathcal M\)}\l…
      得到变异后的不可行环境。

输出成对样本:同一任务指令,E θ \mathcal{E}_\thetaEθ​可行,E θ ′ \mathcal{E}_\theta'Eθ′​不可行,要求智能体分别完成任务 / 主动拒止。

3.2 执行框架‑环境协同演化完整流程

维护环境池E g \mathcal{E}_gEg​(大量可行‑不可行任务对),以及当前版本执行框架H k H_kHk​。每一轮完整流程:

  1. 在全部任务对上运行智能体,收集执行轨迹R k R_kRk​;大模型失败分析器诊断两类失败:可行任务执行失败、不可行任务没有拒止;输出结构化诊断报告F k F_kFk​。
  2. 环境演化分支:基于诊断F k F_kFk​修改底层数据库、工具行为、约束,生成一批新的可行‑不可行任务对;校验可行性。只有这批新任务上当前框架拒止失败比例高于阈值τ = 0.4 \tau=0.4τ=0.4,才接纳进入训练环境池。
  3. 执行框架演化分支:在更新后的环境池上迭代优化框架H k H_kHk​;优化器可以修改提示词、记忆、子智能体、技能工具、控制逻辑,基座模型权重保持完全固定。
    H k , i + 1 = O p t i m i z e ( H k , i , F k , i ) , i = 0 , . . . , n − 1 H_{k,i+1}=Optimize(H_{k,i},F_{k,i}),\ i=0,... ,n-1Hk,i+1​=Optimize(Hk,i​,Fk,i​),i=0,...,n−1
    每一轮候选框架在独立验证集做筛选:必须不降低原有指标,至少一项指标提升,才会被采纳成为新版本H k + 1 H_{k+1}Hk+1​。
  4. 进入下一轮协同迭代。

关键指标定义

  • Abstain拒止成功率:不可行任务中智能体正确选择拒止的占比;
  • Act可行任务完成率:可行任务智能体成功完成任务占比;
  • Pair成对成功率:同一对任务,既正确完成可行实例、又对不可行实例正确拒止的样本占比。

4 实验设置

  1. 数据集
  • 训练池:初始20对任务,经过多轮演化扩充至50对(共100条实例)。
  • HERA‑BENCH留出评测集:60对任务,领域和训练集完全不重叠,经过人工复审,用于评估泛化能力。
  1. 基础执行框架H 0 H_0H0​:基于OpenAI Agents SDK实现的最小工具调用智能体,(\mathcal M)CP协议暴露环境工具,最大执行轮次30。
  2. 模型:主演化过程使用GPT‑5.6‑Luna;演化结束后的最终框架,直接在另外19个闭源/开源大模型上评测,不做任何模型专属修改。
  3. 对比基线
    • H 0 H_0H0​:原始基础框架,无任何优化;
    • H 0 H_0H0​+ abstention prompt:只增加拒止提示词,框架逻辑不变;
    • Harness‑only evolution:仅优化框架,环境集合固定不变;
    • Task‑augmented harness evolution:仅不断新增普通任务对,不做失败驱动环境变异;
    • Task generation fromH 0 H_0H0​failures:只基于初始H 0 H_0H0​的失败生成任务,后续迭代不再更新环境生成逻辑。
  4. 演化超参数:一共6轮协同演化;批次接纳阈值τ = 0.4 \tau=0.4τ=0.4。

5 实验结果

5.1 基准对比(HERA‑BENCH留出测试集)

方法Abstain拒止成功率Act可行任务完成率Pair成对成功率
H 0 H_0H0​原始框架61.7%68.3%48.3%
H 0 H_0H0​+ 拒止提示词68.3%63.3%46.7%
仅框架演化76.7%71.7%60.0%
任务扩充+框架演化80.0%75.0%65.0%
基于初始失败生成任务78.3%75.0%73.3%
HERA协同演化(本文)83.3%76.7%70.0%

HERA同时拿到最高拒止成功率与可行任务完成率;单纯增加拒止提示词会牺牲可行任务的完成效果。在累计训练池50对任务上,HERA达到拒止86.0%,可行任务完成88.0%。

5.2 协同演化动态过程

  1. 新生成的任务批次,刚加入环境池时,当前框架在这批任务上性能偏低;证明环境演化可以定向生成暴露智能体弱点的挑战性任务。
  2. 经过一轮框架更新之后,新批次任务指标得到明显修复;同时旧批次任务性能不会退化。

说明协同演化不会以牺牲原有任务能力为代价换取拒止性能提升。

5.3 跨模型迁移能力

将GPT‑5.6‑Luna演化得到的最终执行框架,直接在19个不同大模型运行,无任何模型专属优化:

  • 拒止成功率平均提升15.3个百分点;
  • Pair成对综合成功率平均提升12.5个百分点。
    增益覆盖闭源、开源全部被测模型;哪怕本身基线很强的GPT‑6‑Astra,同样获得明显提升。证明框架层面的改进具备很强跨模型可迁移性。

5.4 性能‑成本权衡

虽然演化后的框架会带来一定token、API开销上涨(中位数开销×2.09,token×3.31),但可以让低成本模型实现高价模型水平。

示例:HERA加持下GPT‑5.6‑Luna达到70.0%的Pair成对成功率,等价原始H 0 H_0H0​下GPT‑6‑Astra水平;单episode平均API开销从0.0610美元下降至0.0091美元,降低约85%。

6 结论

本文提出HERA,面向智能体主动拒止的执行框架‑环境协同演化框架。

  1. 通过受控环境变异流水线,自动生成可验证的可行‑不可行成对任务,构建HERA‑BENCH基准。
  2. 协同演化闭环:利用智能体执行失败,同时驱动外层执行框架更新、生成针对性挑战环境任务。
  3. 在留出测试集,拒止成功率由61.7%提升到83.3%,可行任务完成率同步提升。演化得到的执行框架可以直接迁移到19个大模型,无需专项适配,带来一致性能增益;可以显著降低达到目标性能所需API成本。
    实验证明:只优化框架或者只扩充任务都存在局限;框架与环境任务协同演化,可以更好提升工具智能体的拒止可靠性。

附录简要说明

  • 附录A:环境‑任务构建完整流程、(\mathcal M)CP工具接口、全部模型列表、推理参数配置。
  • 附录D:HERA‑BENCH人工复审流程、任务对校验标准。
  • 附录E:完整细分实验数据、消融统计、框架迭代逻辑样例。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/7 17:23:49

跨链桥安全测试实战:从攻击面分析到自动化回归用例建设

跨链桥大概是目前区块链世界里最让人“又爱又怕”的组件。爱的是它解决了资产和应用在异构链之间流通的刚需,怕的是过去几年里,每一次登上头条的巨额加密资产被盗事件,几乎都跟跨链桥有关。被攻击的金额动辄数亿美元,攻击手法从智…

作者头像 李华
网站建设 2026/10/7 17:23:31

项目经理被裁却无人说话:职场关系才是真正的职业护城河

上个月和朋友吃饭,聊到一个消息:一位做项目经理的老同事被裁了,通知得突然,当天上午谈完话,下午就要交接工位。最让人不是滋味的是,消息传开后,整个项目组、跨部门合作过的人、甚至连平时关系不…

作者头像 李华
网站建设 2026/10/7 17:22:33

智能体训练资源困境与DSec弹性沙箱基础设施设计实践

前两天在技术群里看到有人吐槽:同样是GPU训练,大模型微调任务跑十几个小时舒舒服服,而手里那堆智能体训练任务却把集群折腾得鸡飞狗跳。这个问题正好戳中我过去半年在做的一件事——在内部落地DeepSeek弹性计算(DSec)。…

作者头像 李华
网站建设 2026/10/7 17:21:42

深度学习模型如何真正适配GPU/FPGA/ASIC硬件?

1. 项目概述:当深度学习模型撞上物理芯片,算法不再“纸上谈兵”你有没有试过把一个在PyTorch里跑得飞快的ResNet-50模型,直接部署到一块FPGA开发板上,结果发现推理延迟从20ms飙到350ms,功耗翻了三倍,最后连…

作者头像 李华
网站建设 2026/10/7 17:21:42

虚拟现实智慧校园技术实现:Maya建模与Unity交互开发指南

简介:这份PDF文献《基于虚拟现实技术的智慧校园设计与实现》面向教育信息化研究者、数字校园建设人员及虚拟现实技术学习者,以某大学为例,系统讲解如何借助虚拟现实技术构建可交互的虚拟校园环境。内容涵盖三维建模、3D模型仿真、Unity 3D引擎…

作者头像 李华
网站建设 2026/10/7 17:21:18

2026年Java面试高频题全解析:从基础原理到实战场景

2026年Java面试题总结,附答案——这句话在不少人的收藏夹里躺了很久了,但真正能照着题目准备到位的人,说实话不多。我当面试官这几年,面过几百个候选人,也帮不少朋友做过模拟面试,最大的感受是:…

作者头像 李华