news 2026/8/8 6:36:18

逃离自我确认陷阱:Agent经验学习的执行-蒸馏-验证新范式

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
逃离自我确认陷阱:Agent经验学习的执行-蒸馏-验证新范式

Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning

作者:Shiding Zhu, Yudi Qi, Yajie Wang, Jiaze Li, Chao Song, Yaorui Shi, Yibo Miao, Hanqi Gao, Kai Zhang
核心发表机构:Zhejiang University、Shenzhen International Graduate School, Tsinghua University、Northwestern Polytechnical University、University of Science and Technology of China、Shanghai Jiaotong University
论文链接:arXiv:2606.24428v1
发布于:arXiv 预印本(cs.CL)

|—|—|—|—|
| NM (Minimax-M2.1) | 61.5 | 82.2 | 85.5 | 76.4 |
| NM (Mimo-V2-Flash) | 64.5 | 79.2 | 91.7 | 78.5 |
| NM (GLM-4.7-FP8) | 64.0 | 78.1 | 96.6 | 79.6 |
| RB (Minimax-M2.1) | 66.0 | 83.3 | 87.7 | 79.0 |
| RB (Mimo-V2-Flash) | 64.0 | 83.3 | 94.7 | 80.7 |
| RB (GLM-4.7-FP8) | 66.0 | 82.5 | 97.2 | 81.9 |
| Judge (Ensemble) | 66.0 | 84.7 | 93.9 | 81.5 |
| Router (Ensemble) | 68.0 | 85.2 | 97.2 | 83.5 |
|EDV (Ours)|72.0|88.6|99.1|86.6|

EDV 在 AIRLINE、RETAIL、TELECOM 三个子域以及平均分数上均取得了最优结果,平均 Pass@1 达到 86.6,比最强基线 Router(83.5)高出 3.1 个百分点,比 ReasoningBank 的最优配置(GLM-4.7-FP8,81.9)高出 4.7 个百分点。三组无记忆基线(NM)仅分布在 76.4–79.6 的区间内,表明 EDV 的增益不仅来自骨干模型的能力提升,更来自记忆构建机制本身的质量保证。值得注意的是,Router 通过能力矩阵在推理时选择求解器也能带来一定提升,但 EDV 的收益明显更大——这说明 EDV 的核心增益并不在于“选择了更好的模型”,而在于“构建了更好的经验”。

Mind2Web 结果

Mind2Web 上的结果更为细致地展现了 EDV 的泛化能力和边界。下表列出了各方法与三种骨干搭配 NM/RB,以及 Judge、Router 和 EDV 的完整数值(%):

设置指标 (上界)Minimax-NMMinimax-RBMimo-NMMimo-RBGLM-NMGLM-RBJudgeRouterOurs
cross-TaskEA (74.26)39.9239.0642.3846.7742.6444.4641.3744.3748.62
AF1 (74.26)59.1459.7558.3161.8355.7457.7856.0057.0263.10
SSR (74.26)34.1933.9537.4842.0138.3140.9235.1440.2843.17
SR (24.21)3.573.173.215.553.844.373.064.374.76
cross-WebsiteEA (64.82)35.0336.4235.5536.8139.2641.6635.0139.9144.79
AF1 (64.82)49.5949.7948.0249.6351.6553.4246.8552.1555.64
SSR (64.82)29.1329.7230.2931.7831.1735.8327.6331.7636.56
SR (20.34)2.822.824.764.123.394.521.873.394.76
cross-DomainEA (65.42)36.2437.9536.4940.0940.4741.1342.6441.8243.39
AF1 (65.42)52.0053.5851.7754.2352.2552.9855.7453.3756.38
SSR (65.42)31.5233.5332.7336.7736.7637.0738.3138.7439.57
SR (18.31)2.742.413.325.053.844.063.844.714.71

EDV 在 EA、AF1、SSR 三个指标上的全部九组评测中均取得了最高分,展现出稳定的全面优势。在跨任务、跨网站、跨域三种设置下,EDV 的 SSR 分别达到 43.17、36.56 和 39.57,显示其在完整步骤序列层面具有突出的连贯决策能力。然而在 SR(任务级成功率)上出现了值得关注的边界:cross-Task 设置下最高 SR 由 Mimo-RB 取得(5.55),cross-Domain 下最高 SR 也由 Mimo-RB 取得(5.05),EDV 分别为 4.76 和 4.71,并非最优;仅在 cross-Website 下 EDV 与 Mimo-NM 并列最高(4.76)。这一结果说明,在极严格的全任务成功判定下,EDV 的步骤级优势并不能完全转化为任务级最优。可能的原因在于,任务级 SR 极易受到任一环节微小错误的影响,而检索模块的 Top-10 截断约束对完整导航链条的破坏作用在跨任务和跨域设置中更为致命。EDV 虽然能通过高质量经验减少决策层面的错误,但无法完全弥补检索召回瓶颈对整个链条的制约。值得强调的是,所有方法的 SR 绝对值都远低于理论上限(24.21%/20.34%/18.31%),这本身就说明长程网页导航任务在现有检索约束下仍有巨大的改进空间。

MMTB 结果

MMTB 上的结果进一步验证了 EDV 在多工具协同场景下的有效性:

MethodOverallA_sglA_chtA_clrA^PA^SA^{S+P}Opt.PathAcc.Prog
NM Minimax51.5656.6483.2036.7242.0412.509.5229.0529.31
NM Mimo46.9056.6469.0531.3741.9418.7511.9014.2241.21
NM GLM52.3454.3074.2239.4548.4125.0025.0040.6647.07
RB Minimax53.6756.4783.9839.8442.0425.0020.7332.2240.03
RB Mimo49.2257.0368.9036.3341.2931.2522.629.6251.09
RB GLM52.6155.2075.0041.0247.1018.7527.7138.2447.22
Judge54.7957.8175.7843.7550.9625.0025.0038.1753.10
Router55.9659.3879.6944.1448.4118.7529.7635.3059.30
Ours58.1060.9484.3846.0951.5937.5029.7639.8350.42

EDV 在 Overall(58.10)上取得了最优成绩,显著高于 Router(55.96)和 Judge(54.79)。在 Action-level 的三个指标上,EDV 均取得最高——特别是在A c h t A_{\mathrm{cht}}Acht(84.38)和A c l r A_{\mathrm{clr}}Aclr(46.09)上的领先幅度较大,说明 EDV 的经验不仅能改善工具调用,还能提升纯对话交互和主动澄清能力。在 Multi-action 层面,EDV 的A P A^{P}AP(51.59)和A S A^{S}AS(37.50)均为最优,A S + P A^{S+P}AS+P与 Router 并列最高(29.76)。但值得注意的是,在 Trajectory 层面的 Acc. Prog 指标上,Router(59.30)显著高于 EDV(50.42)。这表明 Router 在部分完成任务的过程中获得了更高的路径完成度——可能是因为推理时选择最合适模型直接作用于每一步决策,而 EDV 的记忆引导主要影响整体策略方向,在局部路径的“完成进度”上不如直接的模型选择来得立竿见影。不过,EDV 在 Opt. Path(39.83)上仍是最优,说明 EDV 引导智能体选择最优路径的能力更强。

案例研究

三个基准上的定量结果之外,论文还通过具体的案例研究展示了 EDV 经验的实际效果。

)

τ 2 \tau^2τ2-bench 的机票修改案例中(图 7),无记忆基线智能体反复尝试使用旅行凭证(travel certificate)支付改签费用,陷入无限循环——它从未意识到该环境中的关键约束:旅行凭证对预订修改无效。EDV 智能体则检索到了一条经过验证的经验:“Travel certificates are invalid for updates; use credit/gift cards.” 这条经验直接引导智能体绕开了无效的支付方式。图 8 至图 10 进一步展示了该案例的对话细节:基线智能体在对话中反复提交凭证支付请求而不断被系统拒绝,而 EDV 智能体在获得记忆提示后立即选择了正确的支付工具,成功完成了改签。这个案例直观地体现了 EDV 的记忆不是简单的轨迹存储,而是经过多智能体共识过滤后的、可直接指导行动的高质量经验——它能帮助智能体跳出单智能体探索的认知上限。

)

)

)

在 Mind2Web 的案例中(图 11),任务要求将阿姆斯特丹评分最高的活动加入愿望清单。基线智能体基于关键字匹配选择了“4 & up”过滤选项(选项 D),这是一种立即次优的启发式行为——它没有真正理解“评分最高”意味着需要先获取评分数据再比较。EDV 智能体检索到了验证过的记忆:“Verify Information… Actions must lead to actual information retrieval.” 这条记忆引导智能体选择了“Traveler Rating”(选项 J),实现了从概率匹配到程序化验证的转变。这一对比说明 EDV 的双嵌入检索策略能够注入鲁棒的推理模式,缓解孤立探索中的幻觉倾向。

在 MMTB 的翻译案例中(图 12),基线智能体将自然语言描述(“English”“Russian”)直接作为翻译工具的语言参数,未满足工具对 ISO 639-1 代码的严格要求,属于典型的“协议幻觉”。EDV 智能体检索到规范感知记忆:“Use standardized language identifiers (e.g., ISO 639-1 two-letter codes).”,从而将参数修正为 “en” 和 “ru”,成功完成任务。图 13 至图 15 展示了这一案例的完整对话过程,清晰地呈现了基线失败与 EDV 成功的对比。这个案例揭示了共享记忆系统的独特价值——它不只存储操作提示,而是积累“可执行精度”,弥合模糊用户意图与严格系统需求之间的鸿沟。

4.3 消融实验 / Ablation Study

论文在τ 2 \tau^2τ2-bench RETAIL 域上进行了系统的消融研究,以 Pass@1 为指标,逐层拆解 EDV 各设计要素的贡献。

渐进式范式消融

下表展示从最简单的单智能体经验学习到完整 EDV 的渐进式扩展:

方法执行智能体数蒸馏角色验证角色Pass@1Drop(相对完整EDV)
Basic SA1SelfNone83.3-5.3
SA + Self-Verify1SelfSelf83.2-5.4
SA + Indep. Verifier1SelfExternal84.5-4.1
MA + Self-Distill2ExecutorExecutor85.9-2.7
MA + Third-Party Distill2ExternalDistill87.1-1.5
EDV (Full)2ExternalExecutor88.6

这一系列对比揭示了 EDV 设计的四个关键发现。

第一,自我确认陷阱是单智能体固有的,且内部自我检查无法解决。对比 Basic SA(83.3)和 SA + Self-Verify(83.2),显式的自我验证不仅没有带来提升,反而有轻微的性能下降。单一模型在自我审视时倾向于认可自己的错误但自洽的推理,这一现象为“自我确认陷阱”提供了直接的实验证据。

第二,仅解耦执行与验证角色收益有限。当单智能体执行、外部独立验证器进行审查时(SA + Indep. Verifier),Pass@1 仅提升至 84.5(+1.2)。根本原因在于,单条轨迹无法为验证者提供充分的比较参照来识别深层错误——验证者能发现明显的逻辑断裂,却难以辨认出那些在局部语境中看似合理的系统性盲区。这说明轨迹多样性是高质量验证的必要前提

第三,多智能体执行与第三方蒸馏的组合有效释放了多元轨迹的价值。当执行扩展到两个智能体时(MA + Self-Distill),Pass@1 提升至 85.9;但由执行者自我蒸馏存在严重的选择偏差——执行组倾向于保留与自己认知一致的经验,从而浪费大部分信息增益。换用中立第三方蒸馏后(MA + Third-Party Distill),Pass@1 显著提升至 87.1,说明第三方蒸馏器能够更有效地从多轨迹对比中提取可泛化的跨轨迹经验。

第四,共识验证是最终的质量把关。完整 EDV(第三方蒸馏 + 执行组共识验证)达到 88.6,比 MA + Third-Party Distill 再提升 1.5。即使蒸馏器是第三方,它仍有自己的认知局限;执行组的一致验证可以进一步过滤掉蒸馏器未能察觉的残余错误。六个配置的递进关系清晰地展示了 EDV 各阶段各自的贡献:从单智能体到多智能体的解耦带来了 2.6 的提升,第三方蒸馏带来了 1.2 的提升,共识验证则带来了最后的 1.5 的提升。

组件消融

论文进一步消融了 EDV 的推理时组件:

类别变体配置Pass@1Drop
基线EDV-Full动态能力矩阵 + 共享/私有记忆层次88.6
能力矩阵EDV-Fixed移除能力矩阵,固定最佳单一求解器86.6-2.0
记忆层次EDV-Only-Shared移除私有记忆,全部存入共享库85.7-2.9
记忆层次EDV-Only-Private移除共享记忆,全部存入私有库85.9-2.7

移除能力矩阵导致 2.0 的性能下降。能力矩阵通过任务-求解器匹配带来稳定的边际增益,它使得 EDV 能够在推理时选择最合适的智能体——这种选择不是盲目的,而是基于经验构建阶段积累的“哪类任务由哪个智能体处理更好”的分布知识。移除记忆层次带来了更大的性能下降:强制将个性化经验放入共享记忆会导致误用——部分智能体并不适用于该经验描述的情境,检索到它反而产生干扰;移除共享记忆则损害了跨智能体的知识共享和泛化能力。对记忆使用情况的进一步分析揭示了两种记忆类型的互补角色:共享记忆的检索率为 72.3%,每次命中带来 3.2% 的成功率增益,对整体性能贡献 2.3%;私有记忆在 31.8% 的任务中被检索,每次命中增益 1.8%,总贡献 0.6%。两者合计贡献 2.9%,说明私有记忆在近三分之一的边缘任务中补充了共享记忆的覆盖盲区,层次化设计不可被扁平结构替代。

记忆质量审计

论文在τ 2 \tau^2τ2-bench RETAIL 域上对实际存入记忆库的条目进行了人工审计(5 分制):

指标RBEDV变化
Groundedness/Correctness3.724.41↑ 0.69
Actionability3.584.32↑ 0.74
Specificity3.644.27↑ 0.63
Noise/Hallucination1.210.63↓ 0.58
Potential Harm if Reused1.080.51↓ 0.57

EDV 在正确性、可操作性、具体性三个积极维度上全面优于 RB,同时在噪声水平和误用潜在危害两个消极维度上显著低于 RB。这一结果直接量化了 EDV 在记忆插入前过滤低质量信息的能力:共识验证机制不仅是性能层面的提升手段,更是记忆库内容质量的源头保障。

对记忆污染的敏感性

为了直接模拟自我确认陷阱的危害,论文以 RB 为基线,向 RETAIL 任务注入错误但内部连贯的经验(如错误的支付规则),占总记忆量的 10%。结果显示,RB 在τ 2 \tau^2τ2-bench RETAIL 域的 Pass@1 从 82.5 急剧下降至 77.2(下降 5.3 个百分点)。这一结果结合记忆质量审计构成了强有力的证据链:错误经验一旦进入记忆库,其危害远不止“无效”——它们会主动误导后续任务,导致正确行为被覆盖。而 EDV 之所以在真实环境下表现稳健,正是因为它的共识验证机制在源头上截断了这类错误记忆的入库路径。

训练收敛与扩展性分析

论文在附录中提供了 EDV 与 ReasoningBank 在训练收敛、检索记忆数量扩展性以及召回阈值敏感性三方面的对比分析。

图 4 展示了两种方法在不同训练 epoch 下的 Pass@1 变化。EDV 在每个训练阶段均显著优于 RB,差距约为 7%–9%。RB 在第二个 epoch 后出现停滞甚至下降(从 0.830 降至 0.815),而 EDV 保持了持续上升的趋势,并在第 4 个 epoch 达到峰值 0.909。这表明 EDV 的经验库构建路径不易被低质量记忆的累积所阻塞,能够持续从新任务中提取增益。

图 5 展示了检索记忆数量对性能的影响。无经验时两种方法基线相同(0.781)。随着检索记忆数增加,EDV 呈稳健的单调提升,在检索 3 条经验时达到 0.886;而 RB 在检索 1 条经验时达到峰值 0.825,之后下降至 0.793。RB 的下降很可能源于低质量或不相关经验的“干扰”效应——随着检索数量增加,一些由单智能体自我确认产生的错误记忆被引入上下文,反而破坏了决策质量。EDV 更优的过滤与整合机制使其能够有效利用更多的检索数据而不被噪声阻碍,这再次印证了“记忆质量比记忆数量更重要”的核心主张。

)

图 6 考察了召回阈值τ \tauτ对 EDV 性能的影响。EDV 在广泛的阈值范围内保持稳定,Pass@1 始终高于 0.860。最优阈值为τ = 0.8 \tau=0.8τ=0.8,得分 0.886;当τ \tauτ提高到 0.9 时出现轻微下降,说明过严的阈值会过滤掉部分潜在有用的经验;而低阈值可能引入噪声。整体呈钟形曲线,这一结果不仅为超参数调整提供了直接指导,也从侧面说明 EDV 对阈值不敏感的特性使其在实际部署中具备较强的鲁棒性。

推理效率

论文还报告了 EDV 在推理效率方面的优势。在 RETAIL 子集上,EDV 相比 ReasoningBank 在取得更好性能的同时,将平均推理 token 消耗降低了 24.5%。这一效率提升来源于两个因素:一是 EDV 存储的高层战略经验能从全局视角减少冗余操作步骤;二是高质量记忆的引导让智能体在更少的尝试内找到正确路径。EDV 将长时程问题求解的成本从重复在线搜索转移到了高质量的离线经验构建,实现了效果与部署成本的更好平衡。

原论文对应图片(Experience Helps on2 ^22-Bench: A Qualitative Case Study.):

)

原论文对应图片(Experience Helps on2 ^22-Bench: A Qualitative Case Study.):

)

原论文对应图片(Experience Helps on2 ^22-Bench: A Qualitative Case Study.):

)

原论文对应图片(Experience Helps on2 ^22-Bench: A Qualitative Case Study.):

)

五、相关工作 / Related Work

EDV 的研究横跨两个紧密相关的领域:智能体经验学习/记忆多智能体协作

在经验学习与智能体记忆方向,已有大量工作探索了如何让智能体从历史交互中积累可复用的知识。代表性工作包括 AgentEvolver、FLEX、Learning on the Job、Seed-Prover 1.5、MetaAgent 等,它们普遍依赖从历史执行轨迹中提取经验。在智能体记忆方面,ReasoningBank 证明了将原始轨迹蒸馏为推理记忆后比直接使用轨迹更可复用;General Agentic Memory 提出了分层记忆组织方案;CoPS 则探讨了单智能体跨任务经验共享。这些工作的共同特征是,经验构建过程大多遵循单智能体闭环——同一个模型既执行任务,又通过自我反思来总结经验并决定记忆内容。正如论文第二章所分析的,这一模式在无真值反馈的开放世界环境中面临自我确认陷阱的系统性风险。EDV 与它们的根本区别在于,将经验构建的完整管线拆分为执行、蒸馏、验证三个独立环节,并引入了第三方蒸馏和共识验证这两个专门针对“自我确认偏差”的对抗性机制。

在多智能体协作方向,X-MAS 强调模型异质性在协作中的价值,CoMAS 关注多智能体交互驱动的改进,Multi-Agent Evolve 探索了智能体的共同演化,Xolver 则将多智能体协作与经验积累结合起来。这些工作与 EDV 的区别在于关注点的不同:它们主要利用多智能体来提升单任务的解决性能,或者关注经验在智能体之间的分享与转移,但并未系统性地利用多智能体分工来提升经验构建本身的可信性。EDV 将多智能体的协作聚焦于经验构建阶段的验证与过滤——异构执行提供了多样性的证据基础,第三方蒸馏提供了独立的分析视角,执行组共识则构成了最终的质量闸门。这种“为记忆可靠性而协作”的定位,是 EDV 与已有方法在范式层面最显著的差异。

六、局限性与展望 / Limitations & Future Work

论文在讨论局限时坦诚地指出了 EDV 面临的三个主要挑战。

首先,共识偏差风险(Risk of Consensus Bias)。EDV 的验证机制依赖异构智能体的一致性判断来确保经验可靠,但如果异构智能体共享某个失败模式——例如它们基于相似的预训练数据产生了相同的错误倾向——那么共识机制可能无意中验证噪声。换言之,共识并不等同于正确,它只是降低了单个体犯错的概率,但无法消除群体层面的系统性偏差。这一局限在高度同质的模型池中尤为突出,提示实际部署时应尽量选择训练分布差异更大的模型组合。

其次,低质量智能体的干扰问题(Interference from Low-Quality Agents)。在执行组中,一个明显表现不佳的智能体可能阻碍共识达成——它对候选经验投出的否决票可能并非基于合理的判断,而是源于自身能力的不足。这会使验证过程过度保守,将本应有价值的经验也一并丢弃。如何在验证机制中区分“合理的否决”与“能力不足导致的否决”,是一个值得深入的问题。

最后,归因困难(Attribution Difficulty)。在 EDV 中,蒸馏器与执行器之间存在多轮交互,这使得失败归因的复杂度远超线性系统——当经验验证失败时,问题可能出在执行轨迹的多样性不足、蒸馏器提取了错误的信息、验证机制过于严格等多个环节,定位具体环节需要额外的分析成本。

此外,从系统设计角度看,还有两个值得关注的潜在局限。记忆库采用最小增量更新策略,新记忆只做追加,不做聚类、去重或剪枝。这虽然有利于实验的可归因性——避免复杂记忆管理模块引入混淆变量——但长期运行会使记忆库无限增长,带来检索效率和上下文噪声的问题。另外,EDV 依赖多个异构商用 API 的调用,经验构建阶段的离线运行虽然有可并行化的优势,但总体的计算和 API 成本仍然高于单智能体方法,这可能限制其在资源受限场景下的应用。

论文指出的未来工作方向主要有两个。第一是长期记忆动态管理:由于记忆库会持续增长,作者计划引入“记忆价值函数”(memory value function)来进行智能剪枝与合并,丢弃过时数据并合并相似记忆,从而在保持记忆质量的同时控制记忆库规模。第二是自适应智能体扩展:在推理时根据任务复杂度动态调整参与执行的智能体数量,并分析“异构性扩展定律”(Scaling Laws of Heterogeneity)——刻画智能体池从约 3 个扩展到约 10 个时性能的变化规律,为构建更大规模的协作智能体系统提供理论指导。

七、总结 / Conclusion

EDV 论文的核心贡献在于识别了一个此前未被充分正视的系统性问题——单智能体经验学习中的自我确认陷阱——并给出了一个结构清晰、实证充分的解决方案。通过将经验构建过程解耦为 Execute、Distill、Verify 三个阶段,EDV 完成了从“孤立自我反思”到“协作构建与过滤”的范式转换。多智能体的并行执行提供了轨迹多样性,第三方对比蒸馏消除了执行者中心的总结偏差,执行组共识验证则确保了写入记忆的每一条经验都经过了多视角的审查。在τ 2 \tau^2τ2-bench、Mind2Web 和 MMTB 三个基准上的实验表明,EDV 一致地超越了无记忆基线、单智能体记忆方法(ReasoningBank)以及推理时集成方法(Judge、Router),在绝大多数指标上取得了最优结果。系统的消融研究进一步揭示了每个阶段的独立贡献,而记忆质量审计和污染敏感性实验则直接证明了 EDV 在记忆写入前过滤错误和噪声内容的能力。更深远的意义在于,EDV 的实验证据有力地支持了一个关于智能体自我进化的本质洞见:有效的自我进化不仅取决于积累多少经验,更取决于在记忆插入之前构建的经验有多可靠。当智能体不再被自己的认知盲区所禁锢,而是通过群体的多样化视角和共识验证来建立对世界的判断,它才真正获得了持续进化的坚实基础。

原文摘要:Experience-driven self-evolution is critical for large language model (LLM) agents to improve through open-world interaction. However, existing experience learning methods mostly rely on single-agent loops, where the same agent executes tasks, summarizes outcomes, and determines memory content. This setup makes agents vulnerable to the Self-Confirmation Trap: wrong-but-self-consistent trajectories are misidentified as successful experience, leading to cumulative errors during retrieval and reuse. To address this issue, we propose EDV, an Execute-Distill-Verify framework for reliable experience learning. In the Execute stage, multiple heterogeneous agents explore the same task space in parallel to generate diverse candidate trajectories. In the Distill stage, a dedicated third-party agent comparatively analyzes these trajectories to produce candidate experiences, reducing executor-centric summarization bias. In the Verify stage, the execution group validates candidates via a consensus mechanism, and only approved experiences are written into shared or private memory. By decoupling the three stages, EDV transforms experience learning from isolated self-reflection into collaborative construction, filtering erroneous and noisy content before memory insertion. We evaluate EDV on three challenging long-horizon benchmarks: tau2-bench, Mind2Web and MMTB. Results show EDV consistently outperforms strong baselines, validating that reliable experience construction is essential for robust agent self-evolution. Our code is available at https://github.com/shidingz/EDV.

PDF链接:https://arxiv.org/pdf/2606.24428v1

部分平台可能图片显示异常,请以我的博客内容为准

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/8 6:35:44

避坑指南:心理咨询公司哪家靠谱?先看这3个关键指标再选

作为一名在心理咨询领域摸爬滚打5年的从业者,我见过太多家长花了冤枉钱却换不来改变。有的机构用“西式理论”包装,家长听完更焦虑;有的只给孩子做疏导,回家三天打回原形;更有的案例数据全是编的,一问细节就…

作者头像 李华
网站建设 2026/8/8 6:35:05

中小家政店如何用乾灵助手实现私域自动筛选与跟进

中小家政店如何借助数字化工具优化私域自动筛选与跟进对于拥有3至15家门店的本地连锁家政企业而言,单纯依靠传统的电话推销或线下派单已难以应对日益分散的客户注意力。家政公司线上获客方法的核心正在从“广撒网”向“精准转化自动化留存”转变。当公域流量引入后&…

作者头像 李华
网站建设 2026/8/8 6:34:22

构建企业级AI编码规范:从个人配置到团队资产的CLAUDE.md实践

1. 从“个人玩具”到“团队资产”:为什么需要公司级的 CLAUDE.md如果你在团队里用过 Cursor 或者 Claude,大概率已经接触过.cursorrules或claude.md这类文件。它们就像是你和 AI 结对编程时的“私人助理”,能记住你的编码风格、项目规范&…

作者头像 李华
网站建设 2026/8/8 6:32:17

Unity包体优化实战:使用Build Report Tool精准定位与瘦身

1. 项目概述:为什么你的Unity项目包体总是“虚胖”?做Unity开发的朋友,尤其是负责项目上线前的打包和优化,肯定都经历过这样的场景:项目明明没加多少新功能,但最终的APK或IPA文件大小却像吹气球一样又大了一…

作者头像 李华
网站建设 2026/8/8 6:32:11

Web安全十大核心漏洞深度解析:从SQL注入到CSRF的攻防实战

1. 项目概述:为什么我们需要系统性地理解漏洞?在网络安全这个行当里摸爬滚打了十几年,我见过太多因为对基础漏洞一知半解而导致的“翻车”现场。很多刚入行的朋友,甚至是工作了几年的工程师,往往热衷于追逐最新的漏洞利…

作者头像 李华