news 2026/9/27 8:28:23

AI 陪读顶会论文(十八):Agentic Workflow 与 Self-Consistency 自洽性采样:大模型复杂推理的思维树(ToT)与自我反思

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI 陪读顶会论文(十八):Agentic Workflow 与 Self-Consistency 自洽性采样:大模型复杂推理的思维树(ToT)与自我反思

AI 陪读顶会论文(十八):Agentic Workflow 与 Self-Consistency 自洽性采样:大模型复杂推理的思维树(ToT)与自我反思

在探讨如何让大语言模型(LLM)攻克复杂数学竞赛推导、大规模微服务架构设计以及复杂长链路业务决策时,过去人们往往单纯寄希望于“把底座模型参数扩大 10 倍(Scaling Up Model Parameters)”。
然而,吴恩达(Andrew Ng)教授与普林斯顿/Google 团队的研究表明:
一个基于参数较小的中等开源模型(如 8B/70B),只要配备了先进的“智能体工作流(Agentic Workflow)”与“反思自洽性采样框架”,在复杂推理任务上的综合表现,能够轻松碾压未经编排的单次零样本(Zero-shot)超大模型(如 GPT-4o)!

在智能体推理与复杂任务规划演进史上,有四篇奠定现代 Agent 认知架构的里程碑论文:

  1. CoT(Chain-of-Thought,NeurIPS 2022,Wei et al.):思维链单向线性展开;
  2. Self-Consistency(ICLR 2023,Wang et al.):多路径自洽性多数投票采样;
  3. Tree of Thoughts(ToT,NeurIPS 2023,Yao et al.):树形探索、前瞻剪枝与回溯评估;
  4. Reflexion(NeurIPS 2023,Shinn et al.):基于语言反馈的动态口头自我反思。

今天我们借助大模型辅助精读,把 Agentic Workflow 的四大进阶推理范式、思维树(ToT)状态搜索与自洽性投票(Self-Consistency)数学机理彻底讲透。


大模型推理范式四阶进化全景图

graph LR P1[1. 传统输入-输出 (Standard IO)<br>Prompt -> Output (单次直接蹦出答案, 易幻觉)] --> P2[2. 思维链 (CoT)<br>逐步线性推导 Step1 -> Step2 -> Step3] P2 --> P3[3. 自洽性采样 (Self-Consistency)<br>并发采样 N 条不同 CoT 推理路径 -> 多数投票 (Majority Vote)] P3 --> P4[🔥 4. 思维树与反思智能体 (ToT & Agentic Workflow)<br>BFS/DFS 树形状态搜索 + 动态前瞻评估 + 失败自动回溯 Backtracking]

一、Self-Consistency(自洽性采样):基于多数投票消除单次推理偶发错误

核心数学直觉:

对于一个高度复杂的逻辑或数学难题,通往正确答案的推理逻辑路径通常具有高度的一致性(Self-Consistent),而错误的推理路径往往千奇百怪、互不相同!

Self-Consistency 运作流水线:
  1. 多样化温度采样(Temperature Sampling):将模型生成温度设为 $T = 0.7$,使得模型能够探索不同的解题切入点;
  2. 并发生成 $K$ 条独立思维链(如 $K = 10$);
  3. 提取最终结论并进行多数投票(Majority Voting):
    $$\mathbf{\hat{y} = \arg\max_y \sum_{i=1}^K \mathbb{I}\left( \text{extract_answer}(Path_i) = y \right)}$$
graph TD Prompt[输入复杂算法难题] --> Sample[并发温度采样 5 条独立推理路径] Sample --> Path1[路径 1 推导: 最终答案 = 42] Sample --> Path2[路径 2 推导: 最终答案 = 42] Sample --> Path3[路径 3 推导: 算错边界, 最终答案 = 38] Sample --> Path4[路径 4 推导: 最终答案 = 42] Sample --> Path5[路径 5 推导: 最终答案 = 42] Path1 & Path2 & Path3 & Path4 & Path5 --> Vote[🔥 多数投票聚合器 (Majority Voting)] Vote --> Winner[输出绝对高可靠答案: 42 (置信度 80%!)]

实测成效:
仅凭自洽性多路投票,在 GSM8K(小学数学应用题)与 SVAMP 推理基准上的准确率直接提升了12% ~ 18%!


二、Tree of Thoughts(ToT 思维树):将大模型转化为广度优先树搜索求解器

在解决“24 点游戏(Game of 24)”、填字游戏(Crosswords)或复杂分布式架构决策时,单向思维链(CoT)一旦在第 1 步走错,后续所有推导将全盘皆输(缺乏人类走一步看三步与下棋悔棋的能力)。

普林斯顿团队提出的ToT(Tree of Thoughts)将问题求解建模为树形状态空间搜索(Tree Search Problem):

graph TD Root[初始输入状态 s_0: [4, 1, 8, 7]] --> Branch1[步骤 1 分支 A: 4 * 1 = 4 -> 状态 [4, 8, 7]] Root --> Branch2[步骤 1 分支 B: 8 - 7 = 1 -> 状态 [4, 1, 1]] Root --> Branch3[步骤 1 分支 C: 8 / (1 - 7/?) -> 评估不可能] Branch1 --> Eval1[大模型前瞻自我评估: 给出得分 0.8 (有望成功!)] Branch2 --> Eval2[大模型前瞻自我评估: 给出得分 0.2 (死胡同!)] Branch3 --> Eval3[直接剪枝 Prune!] Eval1 --> NextSearch[继续展开分支 A: 深度探索 -> 最终得出 (8 - 4) * (7 - 1) = 24 !]
ToT 四大核心模块:
  1. 思维分解(Thought Decomposition):将复杂大任务切分为有意义的中间步骤(中间状态 $s$);
  2. 思维生成器(Thought Generator):基于当前状态,大模型生成 3~5 个候选的下一步行动分支;
  3. 状态评估器(State Evaluator):大模型对每一个候选状态进行价值评估(Sure / Likely / Impossible或输出 $0 \sim 1$ 分值);
  4. 搜索算法(Search Algorithm):采用BFS(广度优先搜索)或DFS(深度优先搜索 + 回溯 Backtracking)遍历整棵思维树。

三、Reflexion:带有短期记忆与语言反思的自我进化闭环

在执行代码生成或运维操作时,如果执行器(Executor / 单元测试)返回了报错信息(如AssertionError):

graph LR Task[业务任务] --> Actor[Agent 编写代码] Actor --> Sandbox[沙箱执行单测] Sandbox -->|单测报错 RE/WA| Evaluator[评估器捕获错误堆栈] Evaluator --> SelfReflect[🔥 口头自我反思 (Self-Reflection):<br>"我刚才假设了数组非空, 但用例传入了空数组引发 NPE, 下次我必须在入口处加卫语句判空!"] SelfReflect --> Memory[将反思结论存入短期记忆 Memory Bank] Memory -->|携带前一次反思教训| Actor

Reflexion 的强大之处:
它不需要微调模型权重,仅仅通过在 Prompt 中注入**“你上一轮尝试失败了,这是你的自我反思教训”**,使得模型在下一次尝试时成功率飙升 30% 以上!


极简 Python 模拟 ToT 广度优先思维树搜索核心骨架

class TreeOfThoughtsSolver: def __init__(self, llm_client): self.llm = llm_client def solve_bfs(self, initial_state: str, max_depth: int = 3, beam_width: int = 3): current_states = [initial_state] for depth in range(max_depth): candidates = [] for state in current_states: # 1. 为当前状态生成 3 个候选下一步思考分支 next_thoughts = self.llm.generate_thoughts(state, num_samples=3) candidates.extend(next_thoughts) # 2. 大模型作为评估器给所有候选状态打分 (0.0 ~ 1.0) evaluated_candidates = [] for candidate in candidates: score = self.llm.evaluate_state_score(candidate) evaluated_candidates.append((candidate, score)) # 3. 剪枝:仅保留得分最高的 Top-K (Beam Width) 状态进入下一轮深度 evaluated_candidates.sort(key=lambda x: x[1], reverse=True) current_states = [cand for cand, score in evaluated_candidates[:beam_width]] # 检查是否已达到目标终局解 for state, score in evaluated_candidates[:beam_width]: if score >= 0.95: return state # 成功找到全局最优解! return current_states[0]

实习生的学术与工程总结

从单纯的“Prompt 工程”走向“智能体工作流(Agentic Workflow)”,是现代大模型应用研发的一场深刻范式革命。
我们通过Self-Consistency 多数投票消灭随机波动,通过 ToT 思维树赋予模型前瞻搜索与回溯能力,通过 Reflexion 闭环构建自我进化记忆。
这套多维推理与自反思架构,让大模型真正跨越了简单对话的玩具门槛,具备了解决现实世界复杂工程难题的通用推理智能。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/27 8:28:23

外贸网站建设及优化ppt:3个技术栈对比与避坑注意事项

外贸网站建设及优化ppt:3个技术栈对比与避坑注意事项 改个需求建站公司拖一周,这种憋屈谁没受过?很多老板拿着精心制作的《外贸网站建设及优化ppt》去跟供应商对线,结果发现对方连基础配置都搞不明白,沟通成本极高。其实, 外贸网站建设及优化ppt…

作者头像 李华
网站建设 2026/9/27 8:28:12

3个实战案例拆解soho的网站怎么做零代码也能排首页

3个实战案例拆解soho的网站怎么做零代码也能排首页 自己不会代码想做网站,却总被那些复杂的术语和昂贵的开发费劝退?别慌,我见过太多SOHO创业者(个人创业者)因为搞不定技术细节,白白浪费几个月时间。今天咱们不整虚的,直接上 实战案例 ,拆解 soho的网站怎么做…

作者头像 李华
网站建设 2026/9/27 8:27:36

做网站导航用什么开元程序及完整流程实操

做网站导航用什么开元程序及完整流程实操 改个导航栏颜色,建站公司拖了一周还没动静,这种憋屈感太熟悉了。很多设计师转前端,或者刚接手公司官网的运营,一遇到导航菜单这种基础但关键的结构调整,就容易卡在技术选型上。其实, 做网站导航用什么开元程序…

作者头像 李华
网站建设 2026/9/27 8:27:33

网站建设百度云盘避坑指南:3步搞定源码交付不踩雷

网站建设百度云盘避坑指南:3步搞定源码交付不踩雷 别再对着那些套模板的网站发呆了。那个配色像上个世纪的,排版挤得让人喘不过气,客户一看就觉得“不够档次”,这简直是建站行业的耻辱柱。模板网站太丑且功能僵化,根本撑不起品牌调性,更别提后期二次开发了。今天不聊虚的,直接上干货,这是一份实打实的…

作者头像 李华
网站建设 2026/9/27 8:26:59

公司网站维护该谁来做?一文搞懂避坑指南

公司网站维护该谁来做?一文搞懂避坑指南 刚接手新公司的官网,最让人头大的往往不是代码怎么写,而是那套繁琐的备案流程。很多市场朋友一看到“ICP备案”几个字就头皮发麻,觉得流程一头雾水,不知道材料怎么填,不知道进度卡在哪,更不知道出了问题该找谁。其实,备案只是网站上线前的一个关卡,真正决定网站生死的是…

作者头像 李华
网站建设 2026/9/27 8:26:50

网站广告动图怎么做的3个坑与注意事项

网站广告动图怎么做的3个坑与注意事项 改个需求建站公司拖一周,这行话估计戳中了不少人的肺管子。昨天客户突然想换首页 Banner 上的促销海报,我找原建站团队,对方回了一句“排期满了,下周再看”。等这一周,促销期都快结束了。其实,很多中小企业的官网,核心痛点不在于“建”,而在于“改”和“动”。尤其是…

作者头像 李华