HERA:面向智能体主动拒止能力的执行框架‑环境协同演化框架
原文网页:https://arxiv.org/html/2610.06563v1
PDF链接:https://arxiv.org/pdf/2610.06563v1
arXiv编号:arXiv:2610.06563v1 [cs.AI]
摘要
大语言模型工具智能体已经可以完成复杂多步交互任务,但经常无法识别任务不可行、不存在有效解的场景,仍然继续盲目执行。近期研究将该可靠性缺口定义为智能体主动拒止(agentic abstention)问题。现有方案大多针对固定任务集优化模型或者智能体执行框架,在未见过的失效模式上泛化能力有限。
本文提出HERA,面向智能体主动拒止任务的执行框架‑环境协同演化框架。HERA包含两大核心模块:(1)环境变异流水线,通过受控环境变异操作,自动构造可验证的成对任务样本:可行任务(存在解)与不可行任务(应当触发拒止);(2)协同演化流程,利用上一轮任务执行暴露的失败案例,同时驱动智能体执行框架(Harness)适配更新,并且生成新的、针对当前弱点的执行环境与任务。
在留出评测任务集上,经过HERA演化得到的执行框架,将拒止成功率从61.7%提升至83.3%,同时可行任务完成率由68.3%提升至76.7%,在全部对比方法中同时取得最优拒止能力与可行任务完成能力。将这套演化后的执行框架直接迁移到另外19个大模型,无需针对每个模型做专项优化,拒止准确率平均提升15.3个百分点;让成本更低的小模型可以达到高价大模型的性能,预估API开销降低85%。
关键词
大模型智能体;智能体主动拒止;协同演化;执行框架Harness;环境变异;工具使用;评测基准
目录
- 引言
- 相关工作
- 方法:执行框架‑环境协同演化
- 3.1 可验证拒止任务‑环境对的构建
- 3.2 执行框架‑环境协同演化完整流程
- 实验设置
- 实验结果
- 5.1 基准对比
- 5.2 协同演化动态过程
- 5.3 跨模型迁移能力
- 5.4 性能‑成本权衡分析
- 结论
- 附录简要说明
1 引言
大语言模型智能体依靠多轮工具交互完成复杂任务,但存在显著可靠性缺陷:当任务条件缺失、环境不具备执行前提时,智能体无法识别应当停止,依旧持续调用工具执行。这种识别到条件不足主动停止的能力被称为智能体主动拒止。
盲目继续执行会带来多重危害:任务结果恶化、产生不必要API开销与延迟,甚至触发不可逆的危险操作。
现有提升智能体可靠性分为两条路线:
- 模型侧优化:监督微调、强化学习、在线策略优化;直接修改基座模型权重。
- 执行框架Harness优化:固定基座模型,优化外层调度逻辑,包含提示词、记忆、子智能体、工具调用、动作校验、继续/恢复/停止控制逻辑。
相比模型微调,执行框架优化在智能体拒止方向的研究还比较少。针对固定任务集做框架优化只能暴露有限种类失败;当框架适配现有样例后,原有任务很难再暴露出新的弱点,需要同步演化任务分布,生成新的挑战性案例。
本文提出HERA框架,实现执行框架与环境任务协同演化:
- 第一阶段:环境变异流水线,基于可求解的原始任务,通过受控环境变异生成成对样本:同一任务指令,一份环境可行,另一份经过变异后不可行,需要智能体触发拒止。
- 第二阶段协同演化:分析上一轮执行轨迹中的失败,一方面更新智能体执行框架,另一方面针对性生成新环境与任务,专门暴露当前版本智能体的薄弱点;两者互相驱动迭代。
基于HERA构建HERA‑BENCH评测基准,包含60对可验证的可行‑不可行任务对。
主实验使用GPT‑5.6‑Luna作为基础执行模型;将演化完成的执行框架直接迁移到其余19个闭源、开源模型,不做任何模型专属调优,依然获得显著性能增益。
本文主要贡献
- 任务构建流水线:受控环境变异,自动生成可验证的可行‑不可行成对工具交互任务,由此构建HERA‑BENCH基准。
- 执行框架‑环境协同演化范式:利用执行失败同时驱动框架更新、新挑战任务生成;在训练集上拒止成功率86.0%,成对综合成功率78.0%,优于全部基线。
- 强可迁移的执行框架改进:演化得到的框架可以直接跨19个LL(\mathcal M)生效,拒止指标平均提升15.3pp,无需各模型专项适配。
- 性能‑成本分析:使用演化后的框架,低成本模型可以逼近高价大模型效果,实现显著的API开销下降。
2 相关工作
2.1 智能体主动拒止
普通LL(\mathcal M)拒止:模型在信息不足、知识缺失、安全风险场景拒绝回答。
智能体层面的拒止更进一步:多步工具交互环境下,智能体需要判断什么时候应当停止行动。
已有工作大多使用固定环境或者独立生成任务,不会利用智能体运行失败反馈反过来生成新挑战环境。HERA核心创新:框架、环境任务两者协同迭代演化。
2.2 智能体执行框架Harness演化
现有(\mathcal M)eta‑Harness、Agentic Harness Engineering、AEVO等工作,在固定环境集合之上优化外层框架组件(提示词、工具、记忆、子智能体、控制逻辑)。
HERA区别:不只优化框架,同时演化环境与任务分布;新生成任务专门针对当前框架暴露的弱点,应用于智能体拒止问题。
3 方法:执行框架‑环境协同演化
整体分为两大阶段:①可验证可行‑不可行任务‑环境对构建;②执行框架‑环境协同演化闭环。
3.1 可验证拒止任务‑环境对的构建
流水线包含三步:环境构建 → 任务生成 →环境变异
- 环境构建:选定业务语义主题,使用研究智能体构建结构化数据库,生成配套可执行工具集;校验工具合法性,输出原始可执行环境E θ \mathcal{E}_\thetaEθ。
- 任务生成:任务生成器基于环境生成候选任务;使用独立求解器尝试执行,只保留可以成功完成的任务Q θ Q_\thetaQθ,同时保存参考执行轨迹。
- 环境变异:对( E θ , Q θ ) (\mathcal{E}_\theta,Q_\theta)(Eθ,Qθ)生成多条变异提案;使用两套校验策略:
- π s e m \pi_{sem}πsem语义策略:变异后环境语义保持和原主题一致;
- π r e s \pi_{res}πres救援校验策略:确认变异之后不存在其它隐藏路径可以完成原任务。
经过校验的变异算子KaTeX parse error: Can't use function '\(' in math mode at position 10: \mathcal \̲(̲\mathcal M\)作用于原始环境:
KaTeX parse error: Can't use function '\(' in math mode at position 31: …heta'=\mathcal{\̲(̲\mathcal M\)}\l…
得到变异后的不可行环境。
输出成对样本:同一任务指令,E θ \mathcal{E}_\thetaEθ可行,E θ ′ \mathcal{E}_\theta'Eθ′不可行,要求智能体分别完成任务 / 主动拒止。
3.2 执行框架‑环境协同演化完整流程
维护环境池E g \mathcal{E}_gEg(大量可行‑不可行任务对),以及当前版本执行框架H k H_kHk。每一轮完整流程:
- 在全部任务对上运行智能体,收集执行轨迹R k R_kRk;大模型失败分析器诊断两类失败:可行任务执行失败、不可行任务没有拒止;输出结构化诊断报告F k F_kFk。
- 环境演化分支:基于诊断F k F_kFk修改底层数据库、工具行为、约束,生成一批新的可行‑不可行任务对;校验可行性。只有这批新任务上当前框架拒止失败比例高于阈值τ = 0.4 \tau=0.4τ=0.4,才接纳进入训练环境池。
- 执行框架演化分支:在更新后的环境池上迭代优化框架H k H_kHk;优化器可以修改提示词、记忆、子智能体、技能工具、控制逻辑,基座模型权重保持完全固定。
H k , i + 1 = O p t i m i z e ( H k , i , F k , i ) , i = 0 , . . . , n − 1 H_{k,i+1}=Optimize(H_{k,i},F_{k,i}),\ i=0,... ,n-1Hk,i+1=Optimize(Hk,i,Fk,i),i=0,...,n−1
每一轮候选框架在独立验证集做筛选:必须不降低原有指标,至少一项指标提升,才会被采纳成为新版本H k + 1 H_{k+1}Hk+1。 - 进入下一轮协同迭代。
关键指标定义
- Abstain拒止成功率:不可行任务中智能体正确选择拒止的占比;
- Act可行任务完成率:可行任务智能体成功完成任务占比;
- Pair成对成功率:同一对任务,既正确完成可行实例、又对不可行实例正确拒止的样本占比。
4 实验设置
- 数据集
- 训练池:初始20对任务,经过多轮演化扩充至50对(共100条实例)。
- HERA‑BENCH留出评测集:60对任务,领域和训练集完全不重叠,经过人工复审,用于评估泛化能力。
- 基础执行框架H 0 H_0H0:基于OpenAI Agents SDK实现的最小工具调用智能体,(\mathcal M)CP协议暴露环境工具,最大执行轮次30。
- 模型:主演化过程使用GPT‑5.6‑Luna;演化结束后的最终框架,直接在另外19个闭源/开源大模型上评测,不做任何模型专属修改。
- 对比基线
- H 0 H_0H0:原始基础框架,无任何优化;
- H 0 H_0H0+ abstention prompt:只增加拒止提示词,框架逻辑不变;
- Harness‑only evolution:仅优化框架,环境集合固定不变;
- Task‑augmented harness evolution:仅不断新增普通任务对,不做失败驱动环境变异;
- Task generation fromH 0 H_0H0failures:只基于初始H 0 H_0H0的失败生成任务,后续迭代不再更新环境生成逻辑。
- 演化超参数:一共6轮协同演化;批次接纳阈值τ = 0.4 \tau=0.4τ=0.4。
5 实验结果
5.1 基准对比(HERA‑BENCH留出测试集)
| 方法 | Abstain拒止成功率 | Act可行任务完成率 | Pair成对成功率 |
|---|---|---|---|
| H 0 H_0H0原始框架 | 61.7% | 68.3% | 48.3% |
| H 0 H_0H0+ 拒止提示词 | 68.3% | 63.3% | 46.7% |
| 仅框架演化 | 76.7% | 71.7% | 60.0% |
| 任务扩充+框架演化 | 80.0% | 75.0% | 65.0% |
| 基于初始失败生成任务 | 78.3% | 75.0% | 73.3% |
| HERA协同演化(本文) | 83.3% | 76.7% | 70.0% |
HERA同时拿到最高拒止成功率与可行任务完成率;单纯增加拒止提示词会牺牲可行任务的完成效果。在累计训练池50对任务上,HERA达到拒止86.0%,可行任务完成88.0%。
5.2 协同演化动态过程
- 新生成的任务批次,刚加入环境池时,当前框架在这批任务上性能偏低;证明环境演化可以定向生成暴露智能体弱点的挑战性任务。
- 经过一轮框架更新之后,新批次任务指标得到明显修复;同时旧批次任务性能不会退化。
说明协同演化不会以牺牲原有任务能力为代价换取拒止性能提升。
5.3 跨模型迁移能力
将GPT‑5.6‑Luna演化得到的最终执行框架,直接在19个不同大模型运行,无任何模型专属优化:
- 拒止成功率平均提升15.3个百分点;
- Pair成对综合成功率平均提升12.5个百分点。
增益覆盖闭源、开源全部被测模型;哪怕本身基线很强的GPT‑6‑Astra,同样获得明显提升。证明框架层面的改进具备很强跨模型可迁移性。
5.4 性能‑成本权衡
虽然演化后的框架会带来一定token、API开销上涨(中位数开销×2.09,token×3.31),但可以让低成本模型实现高价模型水平。
示例:HERA加持下GPT‑5.6‑Luna达到70.0%的Pair成对成功率,等价原始H 0 H_0H0下GPT‑6‑Astra水平;单episode平均API开销从0.0610美元下降至0.0091美元,降低约85%。
6 结论
本文提出HERA,面向智能体主动拒止的执行框架‑环境协同演化框架。
- 通过受控环境变异流水线,自动生成可验证的可行‑不可行成对任务,构建HERA‑BENCH基准。
- 协同演化闭环:利用智能体执行失败,同时驱动外层执行框架更新、生成针对性挑战环境任务。
- 在留出测试集,拒止成功率由61.7%提升到83.3%,可行任务完成率同步提升。演化得到的执行框架可以直接迁移到19个大模型,无需专项适配,带来一致性能增益;可以显著降低达到目标性能所需API成本。
实验证明:只优化框架或者只扩充任务都存在局限;框架与环境任务协同演化,可以更好提升工具智能体的拒止可靠性。
附录简要说明
- 附录A:环境‑任务构建完整流程、(\mathcal M)CP工具接口、全部模型列表、推理参数配置。
- 附录D:HERA‑BENCH人工复审流程、任务对校验标准。
- 附录E:完整细分实验数据、消融统计、框架迭代逻辑样例。