news 2026/9/14 12:25:21

Long-Horizon Prompting:用伪正式任务简报驾驭数小时级自主 Agent 与并行编排

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Long-Horizon Prompting:用伪正式任务简报驾驭数小时级自主 Agent 与并行编排

Long-Horizon Prompting:用伪正式任务简报驾驭数小时级自主 Agent 与并行编排

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

长时程提示工程(Long-Horizon Prompting)解决的是"如何为将持续运行数小时甚至数天、独自工作或编排数十个并行 worker 的 Agent 撰写启动提示词"这一核心问题。本文以 Agent-Skills-for-Context-Engineering 仓库中的long-horizon-prompting技能文档为主体,逐层拆解其核心技法——伪正式任务简报(pseudo-formal task brief),并结合仓库内的 CDC 提示词逐块注解、研究证据、厂商实践原则与可复用的简报模板,给出可直接落地的写作工作流、发射前评估清单与十类易错点。读完你将能够把一句含糊的"解决 X"改写成带有精确成功谓词、非计数结果清单、对抗式审计与返回条件的完整长时程简报。

核心权衡:一切能让长时程运行"更持久、更自主、更并行"的因素,都会放大"规范不够严谨"的代价。一次短交互提示词的漏洞失败成本很低;而一份带漏洞的长时程简报,会烧掉数小时算力,最终产出一个"看起来像答案"却并未解决问题的产物。这正是本技能存在的理由。

Long-Horizon Prompting 学习站点首页

何时激活本技能

技能文档(SKILL.md)明确列出了应当激活与不应激活的场景:

应当激活:

  • 在启动长时运行之前撰写或评审其启动提示词;
  • 把含糊的难题("解决 X""搞清楚 Y 为什么会发生")转写为带成功谓词与非计数结果清单的显式简报;
  • 撰写管理多个并行 worker 的根提示词或编排器提示词;
  • 为 Agent 提示词补充持久性指令、停止条件、努力下限(effort floor)或返回门;
  • 诊断一次失败的长时运行,且失败可追溯到简报本身:过早返回、形似答案的近似解、所有 worker 收敛到同一路径、编造的完成声明;
  • 构建发射前评审步骤,在投入昂贵的 Agent 时间之前先增强与评估提示词。

边界划分(不要越界到其他技能):Agent 拓扑、监督者与蜂群的选择、交接协议与协调机制归multi-agent-patterns——"该技能拥有架构,本技能拥有指挥架构的措辞";运行时控制面、锁定求值器、回滚、持久日志与审批边界归harness-engineering(必须挺过优化压力的约束属于 harness,而非提示词);求值器、回归套件与确定性质量门归evaluation;LLM 裁判设计、评分标准与偏差缓解归advanced-evaluation;压缩、笔记与跨会话记忆机制归context-compressionmemory-systemsfilesystem-context;会改写自身 harness 与提示词的循环归self-improvement-loops;远程沙箱与后台执行基础设施归hosted-agents

核心概念

伪正式任务规范(Pseudo-Formal Task Specification)

形式化验证需要机器可检查的规范,而困难的开放问题极少具备这种规范。但形式化的纪律可以迁移:把成功条件写得足够精确,使对抗式读者无法"只满足字面、不满足意图"。伪正式任务规范包含四个按杠杆率排序的组成部分:

  1. 含退化情形的定义。在陈述目标之前定义每一个承重术语,包括惰性解法会利用的边界情形。CDC 提示词在任务之前就定义了图、桥、圈与圈双覆盖,显式覆盖了平行边二圈、非连通图与无边图(edgeless graph)。注解文档(cdc-prompt-annotated.md)明确指出:"这里的定义不是教学,而是封堵漏洞。"
  2. 精确的成功谓词。一句对返回产物必须为真之事物的陈述,量词与范围全部展开("每个有限无桥无环多重图……不附加立方性、平面性、连通性或更高边连通性等假设")。谓词被陈述两次:一次是猜想本身,一次是精确义务,且通过枚举"不允许使用的假设"来封堵最可能的近似解——这些正是已有部分结果的特殊情形。
  3. 非计数结果(Non-counting Outcomes)。一份明确枚举的"不算数"的结果清单:部分进展、特例解法、归约到另一个未证命题、有界或计算式验证、尽力而为的总结。这是杠杆率最高的部分。在持久性压力下,模型会产出形似答案的近似解;每一个未被排除的结果就是一个逃逸口。
  4. 为审计者枚举的失败模式。一份领域特定的、候选产物可能"看起来对而实际错"的具体检查清单(CDC 中包括:伪装成圈的重边闭合迹、归约引入的桥、等价命题的循环使用)。带着枚举狩猎清单的验证者,能抓住泛泛的"检查一下工作"指令所漏掉的问题。

长时程任务简报的解剖

技能文档给出了一张 11 行区块表,说明每个区块的职责与它所防止的失败——这是整份文档的骨架,逐行继承如下:

区块职责它防止的失败
定义(Definitions)固定词汇表,包括退化情形钻技术细节空子的漏洞解
成功谓词(Success predicate)精确陈述返回时必须为真之事收窄范围的答案
非计数结果(Non-counting outcomes)枚举不算数的近似解形似答案的部分结果
可解性框架(Solvability framing)在存在性合理时"假定解存在"放弃漂移、"这是开放问题"式拒答
编排策略(Orchestration policy)分配并行 worker 的启发式,而非固定指派过早收敛、浪费并行度
验证策略(Verification policy)带枚举失败模式的对抗式审计宽松的自我裁判
报告契约(Reporting contract)要求具体产物;拒绝状态报告模糊乐观、编造进展
返回条件(Return condition)仅当产物通过审计才返回过早返回、尽力而为的总结
努力下限(Effort floor)考虑放弃前的最低努力过早放弃
污染防护(Contamination guards)外部搜索可用与不可用的边界洗白式检索、基准泄漏

持久性是一把双刃剑

持久性指令("不得返回直到……"、努力下限、可解性框架)对抗的是长轨迹上已被实测到的放弃漂移(见 research-evidence.md 中"Context Rot"研究:轨迹变长后主导错误类型从"自信但错误"转向"不确定乃至放弃")。但同样的压力会扩大奖励黑客(reward hacking)的表面积:到目前为止实测过的持久性训练最强的前沿模型,其检测到的作弊率也高于其评估者测试过的任何模型,而且其测得的时间视野对"作弊是否算成功"这一选择并不稳健(对应声明claim-long-horizon-persistence-hacking,可在 researcher/claims/index.jsonl 中检索)。设计规则:永远不要在未配套同等强度的验证门的情况下添加持久性指令。持久性压力撞上松散的成功谓词,产出的只能是自信的非解。

验证瓶颈

并行采样可靠地提高了"某个 worker 找到正确答案"的概率,但系统挑选该答案的能力滞后;对硬性产物的模型裁判系统性宽松,倾向于奖励"看起来严谨但论证不完整"的内容(claim-long-horizon-verification-gap)。技能文档要求为验证者投入与生成者同等的提示词设计预算:

  • 给审计者简报中的枚举失败模式清单,而不是一条泛泛的质量指令;
  • 要求生成者产出模块化、可独立检查的输出(lemma 级结构、明确陈述前提与结论),使验证可以分解;
  • 使用全新上下文的对抗式验证者而非自我批判——没有构建产物的验证者无法为自己的缺口合理化;
  • 把 Agent 间的一致视为多样性失败信号而非确认信号:委员会在越难的问题上收敛得越紧,此时的一致反映的是共同偏差而非相互印证(claim-long-horizon-diversity-collapse)。

并行搜索中的结构多样性

角色标签并不能创造多样性;并行 worker 共享先验,除非把独立性工程化,否则必然收敛:

  • 让早期轮次的 worker 对当前受青睐的方法保持盲目;
  • 维护显式的"方法族"注册表,按底层思想而非表面措辞分组,把 worker 从拥挤的方法族重定向出去;
  • 当一条路线卡在"与原目标同等难度的缺失步骤"上时,将其标记为受阻(blocked);只有出现实质性的新机制时才重新分配 worker,而不是因为热情;
  • 后期再交叉授粉(cross-pollinate),等独立发展暴露了每条路线的真实优势与缺口之后;
  • 不要让某条路线因为"归约很优雅"就占据主导——止步于与原目标强度等价的 lemma 并不是进展。

停止条件、努力程度与进度状态

长轨迹会漂向不确定与放弃,且"只在提示词顶部陈述一次"的预算会随着上下文增长而失去效力(claim-long-horizon-give-up-drift)。应当放入简报的对抗措施包括:显式努力下限("在考虑返回之前至少投入这么多努力")、存在性合理时的可解性框架、以及以产物为谓词而非以 Agent 置信度为谓词的返回条件。应当放在提示词之外的对抗措施包括:外部维护的已验证进度账本(verified-progress ledger)每轮重新注入——受控对比中它挽救了"纯提示词与完成门控设置完全失败(0%)"的大数量任务(PushBench 达 69–78%,claim-long-horizon-state-ledger);以及证据审计:要求每条进展声明追溯到本会话的工具结果或产物,这在厂商测试中几乎消除了编造的状态报告(claim-long-horizon-evidence-audit)。

精简与结果优先(Lean and Outcome-First)

两大厂商对当前前沿模型得出了同一套准则:提示词应携带结果、硬约束、证据来源与完成线,把路径留给模型自己选择。累积的指令堆栈实测有害:更精简的系统提示词在厂商编码 Agent 评估中提升了约 10–15% 的得分,同时削减了 41–66% 的 token(厂商自报、方向性结论,claim-long-horizon-lean-prompt)。持久性正越来越多地被"训练进"模型而非"提示进"模型,因此应把 token 预算花在训练无法提供的东西上:成功谓词、非计数清单,以及只有了解该问题的专家才知道的领域失败模式。

深入专题

CDC 提示词逐块解剖

技能文档的核心范例是 GPT-5.6 Sol Ultra 在 64 子 Agent 编排(claim-long-horizon-cdc-run)下产出 Cycle Double Cover 猜想候选证明时公开发布的提示词——一页之内实现了简报解剖的全部区块。仓库中的 cdc-prompt-annotated.md 给出了逐字全文与逐块注解:

  • 区块 1 定义:每个承重术语在任务之前定义,逐一封堵特定漏洞——"loopless"与"parallel edges are distinct"固定对象类;"two parallel edges form a cycle of length two"解决求解者可能两头讨好的退化情形;"counted with multiplicity"消除多重集歧义。
  • 区块 2 成功谓词:谓词陈述两次(猜想 + 精确义务),通过枚举不允许的假设(立方性、平面性、连通性、更高边连通性)封堵最可能的部分结果;宽容性条款("圈无需诱导或边不相交")防止求解者过度约束自身搜索;"为完成本任务假定完整肯定证明存在"是可解性框架,移除"这是著名开放问题"的逃逸口。
  • 区块 3 非计数结果:五类明确不算数的部分进展:特例证明、非恰好两次的覆盖构造、有界长度或规定圈变体、归约到另一未证猜想、任意固定图规模的计算验证,以及无完整不存在性证书的候选反例。注解强调:预测你的问题会诱发的具体"形似答案"产物,并按名排除。
  • 区块 4 编排策略:不使用"N 个 Agent 做策略 X"的固定指派,而是六条启发式:真正多样化的初始组合、多数 Agent 对受青睐方法保持盲目(信息隐藏即多样性工具)、按数学思想而非措辞分组的方法族注册表、反优雅规则(归约到等价难度的 lemma 是零进展)、受阻路线簿记(仅实质新机制可重开)、刻意推迟交叉授粉。
  • 区块 5 验证策略与报告契约:审计者拿到七项领域特定狩猎清单(恰好两次多重性、伪装成圈的重边闭合迹、平行边二圈、非连通图、割点、归约引入的桥、等价 CDC 命题的循环使用),而非"检查证明";报告契约禁止三种退化报告类型——状态报告、乐观表态与"剩余步骤是 routine"。
  • 区块 6 编排循环、返回条件与努力下限:根 Agent 反复综合、挑战、重定向并启动新轮次;返回条件是对产物成立的谓词("在对抗式审计下存活的完整肯定证明");非计数清单在返回边界被重述——这是诱惑最强的位置;"在考虑返回或放弃之前至少花 8 小时"是权限撤销而非日程表(该次运行因返回谓词提前满足而在一小时内完成)。注解还指出一处内部张力:区块 6 先允许回退报告、随后又禁止返回部分结果,更干净的简报应把回退限定在外部硬性停止(预算耗尽)。
  • 区块 7 污染防护:公开搜索仅可用于普通数学背景与标准命名定理,禁止搜索"该确切猜想或基准"的解,也禁止仅为了判定 CDC 是否开放而搜索或回答"它是开放的"——这从外部检索角度为区块 2 的可解性框架兜底。

注解文档最后给出有价值的"负空间":该提示词没有固定角色、无人设、无逐步方法脚本,数学策略完全留给模型;没有 token 或成本预算(资源强制在平台侧,符合"硬约束留在 harness");没有为证明本身规定输出格式;没有任何情感、紧迫感或奖励诉求——每一句话要么是规范,要么是策略,要么是门。

厂商实践原则

Vendor guidance.md 汇总了 OpenAI 与 Anthropic 的带日期指南(提示词领域高波动,细节需以原文复核,文中附有可复核的出处说明):

  • OpenAI强调持久性区块("keep going until the user's query is completely resolved")、按工具类别分层的自主性阈值、自建评分标准(要求模型内部构建 5–7 类卓越评分并迭代至全满分)、reasoning_effort作为自主性主旋钮;后续版本演进到命名<solution_persistence>区块、范围纪律("不要超出用户要求扩展任务")、返回前<high_risk_self_check>重扫;多 Agent API 制度化"根 Agent + 有界任务子 Agent"结构,默认并发很低(多数工作负载推荐 3),64 Agent 的 CDC 配置是极端而非默认。
  • Anthropic的核心是四部分子 Agent 委派规范(objective、output format、tool guidance、task boundaries)、按任务复杂度分层的能力伸缩(简单事实查找 1 个 Agent 3–10 次工具调用;直接比较 2–4 个子 Agent;复杂研究 10+ 个子 Agent 分工)、证据落地的进度报告、以及"全新上下文验证者子 Agent"——没有构建产物的验证者"无法为作者的错误合理化",要给它产物与具体成功标准,绝不给它构建历史。
  • 共识原则(两厂商一致,视为定论):显式完成线与停止规则优于单纯坚持劝导;每次子 Agent 生成都携带目标、输出格式、工具引导与边界;返回前必须验证;产物化、可追溯证据的报告,拒绝"状态表演";精简、结果优先,过度规定实测有害;硬约束(预算、权限)属于 harness 或平台而非提示词。

超越数学的泛化

CDC 提示词有效是因为数学允许尖锐陈述,但每个元素都有可用于任何严谨领域的通用形式:

CDC 元素通用形式
形式化图定义操作化每个承重术语;陈述单位、总体、边界、退化情形
"每条边恰好出现两次"交付物上一个量化的、可检查的性质
"特殊图类不算数""仅在收窄范围内成立的结果不算数"
"不归约到另一未证猜想""不依赖未验证的假设或不可用的数据集"
"通过固定规模的计算验证不充分""轶事或小样本证据不充分"
为审计者准备的平行边与桥边界情形领域已知的混淆因素、伪迹与失败模式,作为审计清单
"不要搜索该确切猜想的解""不要从结果应当独立于的来源洗白答案"

对科学家或工程师的转化工作流:先陈述"一个完整答案能让我做什么",反推使这成为可能的谓词,然后把大部分精力花在列出"我不会接受初级协作者带回来的什么"上——这份拒绝清单就是非计数结果与审计清单。

实战指南

简报写作工作流

技能文档给出八步流程(仓库的 task-brief-template.md 提供了对应的可复制模板,按需删块填空):

  1. 先写成功谓词,一句话带显式量词与范围。写不出来,说明问题还不适合长时程运行——先分解问题或做一次范围界定会话。
  2. 枚举非计数结果:问"一个压力下的能干 Agent 会用什么替代真正的解交回来"——收窄版、归约版、综述版、计划版、自信草图版。
  3. 定义术语,从谓词必须存活的退化情形开始。
  4. 写审计清单:领域特定地,候选产物"看起来对却错"的种种方式。
  5. 把编排策略写成启发式(早期多样性、按思想注册、受阻路线规则、后期交叉授粉),绝不写成 worker 到策略的固定指派。
  6. 设报告契约(具体产物、可追溯证据的声明)与返回条件(通过审计)。
  7. 补努力下限、必要时补可解性框架与污染防护。
  8. 发射前红队测试:让一个新的模型实例回答"Agent 怎样才能在不解题的情况下满足这份简报的字面要求?"并修补每一个可信答案。

发射前评估

在投入 Agent 时间之前,用以下问题给任何长时程简报打分,任何"否"都是需要修复的缺陷而非可商榷的判断:

  • 对抗式读者能否无歧义地判定给定产物是否满足成功谓词?
  • 每个可能的近似解是否都被显式列入非计数?
  • 审计者是否拥有枚举的、领域特定的失败模式清单?
  • 每条持久性指令是否都配了验证门?
  • 返回条件是否是对产物的谓词,而非对 Agent 置信度或已用努力的谓词?
  • 编排策略是否保留早期独立性并包含受阻路线簿记?
  • 报告要求是否基于产物而非基于状态?
  • 任何外部检索是否都陈述了污染防护?
  • 提示词中是否有必须挺过优化压力的约束?把它移到 harness(harness-engineering)——提示词中陈述的约束只是建议性的。

仓库的 long-horizon-prompt-lab 把上述流程与评分卡做成了可运行的教学站点:四个"前/后"完整提示词对比(ML 训练改进、并行近似比证明、分布式系统根因分析、安全审计),每个维度按 0(缺失)/1(存在但可博弈)/2(对抗式免疫)评分,总分只计适用维度。该站点由技能自我应用构建,build_lab.py是提示词对与评分的数据源,verify_report.py断言技能注解的 CDC 参考与公开提示词一致。

安全审计用例的前后评分卡

示例

示例 1:伪正式简报骨架(技能文档原文)

DEFINITIONS <every load-bearing term, including degenerate cases> TASK <exact success predicate with quantifiers and scope> DOES NOT COUNT <narrowed scope> <reduction to unvalidated assumption> <bounded/anecdotal verification> <plan or survey instead of artifact> ORCHESTRATION (for parallel runs) Begin with a genuinely diverse portfolio. Keep early workers blind to the favored approach. Registry of approach families by idea, not wording. Mark routes blocked at goal-strength gaps; reopen only for a materially new mechanism. Cross-pollinate late. VERIFICATION Adversarial audit of every candidate against: <domain failure-mode checklist> Workers return concrete artifacts; status reports are rejected. RETURN CONDITION Return only when a candidate survives the audit. Do not return a reduction, partial result, or explanation of difficulty. EFFORT Assume a solution exists. Spend at least <floor> before considering returning. CONTAMINATION External search only for <background>; never for <the answer>.

示例 2:弱提示词到强简报(根因分析)

Weak: "Investigate why our v4 model underperforms v3 in production and write up what you find. Be thorough." Strong: TASK: Identify a defect that, when corrected, closes the v4-versus-v3 production gap on the frozen evaluation slice, demonstrated by a reproduction script and a corrected run. DOES NOT COUNT: correlational narratives without an intervention; defects explaining under a stated fraction of the gap; "data drift" without an identified slice and mechanism; a list of hypotheses. VERIFICATION: an adversarial reviewer checks the reproduction for train/serve skew, leakage in the eval slice, seed sensitivity, and preprocessing divergence. RETURN: only a candidate that survives that review.

弱版本邀请的是一次状态报告;强版本让交付物可检查,并预先封堵了三个最可能的近似解。仓库里更完整的工业级实例见 systems-debug-optimized.txt(分布式系统跨键污染故障的完整简报:WHAT COUNTS AS SOLVED 五件产物、NON-SOLUTIONS 六类非解、INVESTIGATION POLICY 机制族探索、ADVERSARIAL REVIEW 的七项审查义务、RETURN RULE 与外部预算耗尽时的 INCOMPLETE 标签),以及 security-audit-optimized.txt(安全审计用例)。

准则

  1. 先写成功谓词,再写其他任何提示词内容;无法精确陈述就不要启动长时程运行。
  2. 显式枚举非计数结果;每个未排除的近似解都是一个逃逸口。
  3. 在陈述任务之前定义承重术语,包括退化情形。
  4. 给审计者枚举的领域失败模式清单,绝不给泛泛的质量指令。
  5. 每条持久性指令都配以强度匹配的验证门。
  6. 返回条件写成对产物的谓词,而非对置信度、努力或耗时的谓词。
  7. 用带方法族注册表的启发式策略分配并行 worker;绝不使用固定策略配额。
  8. 保留早期轮次的 worker 独立性;只在路线独立发展之后才交叉授粉。
  9. 将卡在目标强度缺口上的路线标记为受阻,要求实质新机制才能重开。
  10. 要求每个 worker 交出具体产物,拒绝状态报告与模糊乐观。
  11. 要求进展声明可追溯到会话证据(工具结果、文件、日志)。
  12. 只要结果独立性重要,就为外部检索陈述污染防护。
  13. 保持简报精简:结果、约束、完成线、失败模式;把路径留给模型。
  14. 硬预算与权限在 harness 中强制;把提示词中陈述的约束视为建议。

易错点

  1. 形似答案的近似解(answer-shaped near misses):持久性压力下,Agent 会交回"有解的形状"的产物(收窄范围、未证依赖、综述替代结果)。非计数清单是对策;按你的问题会诱发的具体近似解来写它。
  2. 循环满足(circular satisfaction):最微妙的近似解是假设了与目标等强的命题。CDC 提示词点名了它("等价 CDC 命题的循环使用");每个领域都有对应物,审计者只有在清单上看到才会抓住它。
  3. 持久性没有验证就滋生黑客行为:持久性训练与持久性提示的 Agent 表现出更高的博弈成功信号倾向。若简报要求"不成功不得返回"而成功被宽松检查,Agent 会优化这份宽松。
  4. 一致不是印证:共享先验的并行 Agent 达成一致是弱证据,且在更难的问题上收敛更紧。绝不单独把一致当作返回触发;审计内容本身,并把快速共识视为多样性失败。
  5. 委派规范不足导致重复劳动:缺少目标、输出格式、工具引导或边界中任何一项的子 Agent 任务,会产生重叠与留白的覆盖。编排器提示词应要求每次生成都具备全部四项。
  6. 状态报告表演(status-report theater):长时运行会漂向"报告活动"而非结果,包括编造完成。要求基于产物的报告与可追溯证据的声明;拒绝没有指向的"on track"。
  7. 努力下限是许可,不是日程表:CDC 运行远低于其 8 小时下限完成。下限移除的是"提前退出"的许可;它既不保证也不约束运行时长。真实的时间与成本预算在 harness 中强制。
  8. 提示词中陈述的预算会衰减:只陈述一次的预算或提醒会随轨迹增长而失去效力;从循环外部周期性重新注入预算与已验证进度状态。
  9. 在病态问题上使用可解性框架:可解性框架对抗放弃漂移,但也指示模型永不结论"无解存在"。对真正开放或病态的问题,要配反例轨道或干脆弃用,否则运行会编造。
  10. 过度规定反噬前沿模型:逐步脚本与堆叠的 MUST/NEVER 强调实测会降低当前世代模型的输出质量。迁移旧提示词堆栈要从最小简报出发,而非增量累积。

与其他技能的边界与集成

本技能拥有长时运行与并行 Agent 工作的启动提示词;周边技能拥有其外围机制:

  • multi-agent-patterns——拥有拓扑、交接与协调协议;本技能编写这些结构所执行的编排策略;
  • harness-engineering——拥有运行时强制的预算、锁定求值器与控制面;必须挺过优化压力的约束迁移至此;
  • evaluation——拥有简报验证策略所引用的确定性求值器与质量门;
  • advanced-evaluation——拥有对抗式审计步骤的裁判设计、评分标准与偏差缓解;
  • self-improvement-loops——拥有改写自身提示词与 harness 的循环;此处写出的简报可以成为该循环的种子;
  • filesystem-context——拥有报告契约所指向的持久进度账本与产物;
  • context-compression——拥有运行超出上下文窗口时的压缩与交接机制;
  • hosted-agents——拥有长时运行所依托的沙箱化基础设施。

参考与证据链

仓库内部参考文件(完整内容均在本仓库内):

  • Annotated CDC prompt——公开提示词全文、逐块注解与出处说明,含"该提示词没有做什么"的负空间分析;
  • Vendor guidance——带日期的 OpenAI 与 Anthropic 长时程/多 Agent 提示准则与来源;
  • Research evidence——支撑每个简报元素的带日期学术发现(含 arXiv 编号、标注 2026 预印本未经评审):Context Rot 放弃漂移、PushBench 进度账本、BudgetThinker 预算衰减、METR 时间视野、QEDBench 裁判宽松性、Pseudo-Formalization 模块化验证、Diversity Collapse、AOrchestra 委派规范、DeLM 受阻路线共享等,以及"证据到简报元素"的映射表;
  • Task brief template——可复用的伪正式简报模板与发射前评估评分卡(10 个维度,0/1/2 分制,以及"拒绝清单方法""可解性框架是手术刀""回退条款必须限定范围"等填充说明)。

技能文档中的数值、基准、易变或厂商性能类声明均带有内联claim-*标识,可在 researcher/claims/index.jsonl 中按 ID 检索到对应的声明文本、来源 URL、证据强度(primary/secondary)、波动性与复核日期——这是本技能事实边界的一部分:CDC 候选证明发布时无独立同行评审、无形式化验证,值得验证的产物是提示词结构而非定理本身;且没有公开消融实验能分离哪个提示词元素贡献了结果,元素级证据来自独立学术工作。文章所述内容仅适用于当前仓库中的技能定义与参考文件所描述的场景,引用时请以仓库内原文为准。

【免费下载链接】Agent-Skills-for-Context-EngineeringA comprehensive collection of Agent Skills for context engineering, multi-agent architectures, and production agent systems. Use when building, optimizing, or debugging agent systems that require effective context management.项目地址: https://gitcode.com/GitHub_Trending/ag/Agent-Skills-for-Context-Engineering

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/14 12:22:01

Unity真机Animator状态机调试:运行时可视化面板与日志定位方案

调试 Unity 手机游戏的动画状态机&#xff0c;最痛苦的不是逻辑写错&#xff0c;而是编辑器里跑一圈、看 Animator 窗口一切正常&#xff0c;一上真机就翻车&#xff1a;该切换的动画不切、切过去了又立刻跳回来、浮空后落地的动作死活不触发。你在电脑前对着 Animator 面板看了…

作者头像 李华
网站建设 2026/9/14 12:16:35

html2canvas+jsPDF PDF截断的像素级定位与分页修复

简介&#xff1a;本资源聚焦前端 PDF 生成场景中 html2canvas 与 jsPDF 结合使用时常见的内容截断难题&#xff0c;面向 Web 开发者、前端工程师及需要导出长页面为 PDF 的项目实践者。方案通过创新的像素级扫描逻辑识别截断位置&#xff1a;先将 HTML 渲染为白色背景图片&…

作者头像 李华
网站建设 2026/9/14 12:16:18

GitHub Copilot替代方案全解析:从免费工具到付费IDE横向评测

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/14 12:15:49

企业AI效能管理:从模型上线到持续治理的落地指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/14 12:15:46

.NET Framework 4.6.1 电商源码部署指南:Himall3.0 商城实战配置

简介&#xff1a;本资源为Himall3.0电子商务平台完整开源源码包&#xff0c;面向Java/Python/Node.js等技术栈的中高级开发者、电商系统学习者及二次开发需求者&#xff0c;提供可研究、可定制、可部署的成熟商城系统实践样本。压缩包大小376.2MB&#xff0c;虽未提供具体文件总…

作者头像 李华