Agent 的能力不靠模型靠「装备」:NUS JIT-Agent 即时生成操作框架,最高涨 20.2 分还反超 GPT-5.6
Hugging Face 每日论文(2026-08-27 精选)
同一个大模型,换一套「怎么用它的操作框架」,成绩能差出 20 分。新加坡国立大学 LV-NUS 实验室 8 月 27 日挂在 arXiv 上的 JIT-Agent(arxiv:2608.25593),把这句话做成了可复现的实验:模型权重一字不改,只把 Agent 的「记忆怎么管、计划怎么排、动作怎么做、工具怎么调」这套外挂配置从人工手写换成模型即时生成,几个主流开源模型在 DeepSearchQA、OdysseyBench、AgentIF 等四个 Agent 基准上的成绩集体上涨,最高涨 20.2 分,其中一款模型在 DeepSearchQA 上以 +9.1 分反超 GPT-5.6。8 月 27 日这篇论文登上 Hugging Face 每日论文榜,拿到 47 个 upvote。
这件事对正在做 Agent 产品的研究者意味着:当大家都在堆参数、换更大的模型时,JIT-Agent 给出的是一条完全不同的涨分路径。它证明「Agent 的智能不只在模型权重里,也在模型外面那层会随任务变化的外挂装备里」,而这层装备第一次可以被另一个模型即时生成、即时修复、即时进化。
为什么「怎么用模型」和「用哪个模型」一样重要
过去两年训练 Agent 的默认思路是:把推理和行动能力塞进模型权重,模型越大越强,Agent 就越强。这个思路对了一半。JIT-Agent 论文给出的判断是:Agent 的最终能力由两个因素共同决定,一个是产生推理与动作的基础模型,另一个是把模型放到闭环执行环境里的那层 harness。harness 决定保留哪些历史、形成什么意图、暴露哪些工具、动作怎么执行、什么时候触发验证与恢复。
「一个强模型放进错误的记忆、规划、动作协议里也会翻车」这句话听起来像常识,但过去很少有工作把它当成一个可训练的对象来对待。JIT-Agent 的核心主张是把 harness 从「工程实现细节」提升为「和模型权重同等重要的一等公民」。它甚至更进一步,提出一个问题:如果 harness 这么重要,为什么不让一个模型专门负责即时生成 harness?
论文里给出一个直观比喻:模型是引擎,harness 是变速箱和方向盘。同一台引擎,配错挡位和方向盘的用法,跑出的成绩天差地别;配对了,发动机的动力才能真正发挥出来。
提前编译 vs 即时生成:AOT 与 JIT 的分野
harness 优化并不是全新方向,最近一年已有不少工作在做 test-time harness 优化:从轨迹和反馈里优化 harness 代码、prompt、工具、记忆、技能或控制策略。但 JIT-Agent 论文指出,这些工作大多共享一个「提前编译」(AOT, Ahead-of-Time)假设:把 harness 当成一个要长期优化的产物,希望优化出来的结果能泛化到未来的任务、领域或模型版本。
AOT 思路在部署分布稳定、同质时很有效,但它要求优化循环在见到每个具体问题之前,就先预编译出一套足够通用的 harness。问题在于:不同任务需要完全不同的 harness 先验。广搜类任务适合并行证据探索;终端类任务适合精简的串行 ReAct 循环;深研类任务需要承载检索证据的工作记忆;从自然语言到代码仓库的任务天然适合以文件系统为中介。合适的 harness 不仅随领域变化,甚至随实例变化。
JIT-Agent 给出另一种答案:模型即 harness(Model-as-a-Harness)。用一个经过训练的元模型(meta-agent),在见到具体任务的当下,当场合成一套任务专属 harness,然后任意一个现成的 Agent 模型在这个 harness 下执行。harness 不再是一个「提前编好的通用产物」,而是一个「见到题就现场写」的即时产物。
| 对比维度 | AOT 提前编译 harness | JIT 即时生成 harness |
|---|---|---|
| 何时构造 | 见到任务前预先优化 | 见到任务当场生成 |
| 泛化方式 | 靠产物泛化到未来任务 | 靠生成器即时适配当前任务 |
| 对任务分布变化的适应 | 弱(部署分布变则失效) | 强(每任务独立生成) |
| 核心成本 | 大规模搜索 + 海量轨迹积累 | 训练一个紧凑的 harness 生成器 |
| 代表系统 | 多种 test-time harness 优化方法 | JIT-Agent |
四模块协议:把 harness 变成机器可生成的产物
要让模型能即时生成 harness,第一步是把 harness 形式化成机器可生成、可组合的产物。JIT-Agent 论文给出的做法是固定一套四模块协议:
第一,记忆模块。决定 Agent 保留哪些历史、遗忘哪些信息、如何组织长期与短期记忆。
第二,规划模块。决定 Agent 如何拆解任务、如何组织子目标、如何调度执行顺序。
第三,动作模块。决定 Agent 以什么协议与环境交互,是串行 ReAct 循环、并行探索还是别的执行范式。
第四,能力模块。决定 Agent 暴露哪些工具与技能、如何调用、如何做工具链编排。
四个模块不是孤立的,它们被组织成一个可执行、可状态化的协议。JIT-Agent 在推理时接收任务描述、协议定义、可执行工具注册表,以及一小段从历史 harness 库检索到的先例上下文,然后输出一个针对当前任务定制的可执行 harness。生成的 harness 再去包裹一个现成的 Agent 模型执行。
这里的关键动作是「实例化」而不是「组合」。JIT-Agent 不是把几个固定模块简单拼起来,而是根据任务结构实例化出不同的执行协议与状态组织。深研任务的 harness 与代码生成任务的 harness,走的是两套不同的记忆组织、规划节奏与动作协议,但它们都遵守同一个四模块协议。
三种 harness 智能:自适应、可靠、可进化
把 harness 生成当作训练目标,论文提炼出三组核心要求,它们一起定义了「harness 智能」:
第一,自适应性(Adaptivity)。生成的 harness 要匹配当前任务与底层模型。同一个任务换一个模型,最优 harness 可能完全不同,生成器要能跟着变。
第二,可靠性(Reliability)。生成的 harness 必须可执行、行为稳定;合成失败时还要能恢复,不能生成一套跑不起来的配置。
第三,可进化性(Evolvability)。执行过程中积累的反馈与轨迹要能被转译成更强的未来 harness,让整个系统越用越强。
围绕这三组要求,JIT-Agent 走的是一个三阶段训练配方。第一个阶段面向自适应,在协议诱导出的 harness 空间里训练生成器学会按任务合成合适配置;第二个阶段面向可靠性,训练生成器在合成失败时识别并修复,保证可执行;第三个阶段面向可进化性,让生成器从不断扩充的历史 harness 配置库里蒸馏性能信号,实现自我进化。训练完成后,生成器本身是固定的,但它在推理时生成的 harness 会随任务与反馈不断演化。
| 智能维度 | 要解决的核心问题 | 训练阶段 | 运行时表现 |
|---|---|---|---|
| 自适应 | 生成的 harness 匹配任务与模型 | 阶段一:任务适配合成 | 每任务现场生成专属配置 |
| 可靠 | 保证可执行并能在失败时恢复 | 阶段二:失败识别与修复 | 合成失败自动修复重试 |
| 可进化 | 把执行反馈变成更强的未来 harness | 阶段三:历史配置蒸馏 | 越用越强,harness 库持续扩充 |
权重不动、分数涨 20 分:四个基准的实验结果
JIT-Agent 的实验横跨 DeepSearchQA、OdysseyBench、AgentIF 与工作区类任务四个代表性 Agent 基准,覆盖深度研究、日常任务、规划、工作区四类场景。论文给出的核心结果分三块:
第一块,用 JIT-Agent 当 harness 助手后,一款开源模型在 DeepSearchQA 上拿到 +9.1 分、在 OdysseyBench 上拿到 +4.3 分,反超 GPT-5.6。这是「不换模型、只换操作框架」就能打败更大模型的直接证据。
第二块,另一款本身已经很强的开源模型,在 JIT-Agent 生成的 harness 帮助下最高涨 +20.2 分。说明「强者配好装备」的增益比「弱者配好装备」更夸张,基础模型越强,正确 harness 释放的潜力越大。
第三块,在受控对比评测里,JIT-Agent 生成的 harness 与成熟 Agent 运行时 OpenCode、Claude Code 的默认配置性能相当,同时能一致改进多个规模的模型家族。也就是说,它不是只在某个特定模型上有效,而是对多代际、多规模的开源模型都稳定涨分。
| 评测对象 | 基准 | 结果 |
|---|---|---|
| 开源模型 A + JIT-Agent | DeepSearchQA | +9.1 分,反超 GPT-5.6 |
| 开源模型 A + JIT-Agent | OdysseyBench | +4.3 分,反超 GPT-5.6 |
| 开源模型 B + JIT-Agent | 最强基线的对应基准 | 最高 +20.2 分 |
| JIT-Agent 生成的 harness | 受控对比 | 与 OpenCode、Claude Code 性能相当 |
| 多规模开源模型家族 | 四个基准 | 一致改进 |
第三块数据里还有一个常被忽略的工程含义:JIT-Agent 是「紧凑」模型,作为 harness 生成器的成本远低于再训练或再买一个更大的主模型。把「模型变大」这条路的边际成本,换成了「装备即时生成」这条路的低边际成本。这正好对上了论文反复强调的一句话:harness 智能是独立于模型规模、可训练、可迁移、可叠加的能力维度。
为什么「即时生成」在工程上成立
「当场生成 harness」听起来像多绕了一层,工程上真的划得来吗?论文给出的逻辑有三层:
第一层,harness 是实例相关的。不同任务需要不同 harness,这个事实让「提前编译一个通用 harness」这件事天然低效。与其在巨大的设计空间里搜索一个能覆盖所有任务的产物,不如训练一个紧凑生成器,在每个任务到来时只生成针对它的配置。后者省掉的搜索成本,远大于生成器本身的推理成本。
第二层,harness 是低频更换的。一个任务跑起来之后,harness 可以稳定用很久,中途只需按反馈做小修。所以「即时生成」的成本是一次性的,而收益是整次任务全程的。
第三层,harness 库是可累积的。每跑完一个任务,生成的 harness 与它的执行反馈会回到历史库里,成为下一次生成的先例上下文。这是一个复利结构:跑得越多,生成器能参考的好配置越多,后续任务涨分越快。
这三层加在一起,回答了「为什么不是预先优化而是即时生成」这个根本问题。它不是工程上的倒退,而是把 harness 设计从「一次性人工工程」改造成了「持续自我进化的生成式基础设施」。
留给 Agent 研究者与工程团队的三件事
第一件:把 harness 当成和模型权重并列的一等公民来优化。JIT-Agent 用 +20.2 分和反超 GPT-5.6 的结果证明,模型外那层操作框架的增益,一点不比换更大的模型小。预算有限时,先看看是否还能在 harness 层挤出分数。
第二件:放弃「一套 harness 打天下」的假设。任务实例相关的本质意味着,最合适的状态是每个任务类甚至每个任务实例都有自己的配置。与其维护一整套过度工程化的通用框架,不如把精力花在训练一个能按需实例化的生成器上。
第三件:让 harness 配置沉淀成复利资产。执行反馈、任务轨迹、修复记录,这些都应被持续回收进历史配置库,成为下一次生成的先例。harness 智能不是一次性买断的能力,而是会随使用次数不断叠强的能力。
JIT-Agent 给出的不只是一个新模型,而是把「Agent 为什么强」这个问题的答案从「模型权重」扩展到「模型 + 装备」两个维度。对 2026 年的 Agent 研究者来说,这可能比再堆一个 10 倍参数的模型更值得关注。