2026 年,Anthropic、OpenAI 相继把「递归自我改进」(Recursive Self-Improvement, RSI)从论文概念推到了公众视野,也把它最刺耳的那面亮了出来:如果一个 AI 能不断地改进自己的改进能力,它的能力曲线会不会脱离人类的理解与控制?
绝大多数讨论都默认 RSI 等于「模型改自己的权重、或者生成下一代模型」。但 Google DeepMind 联合马里兰大学、弗吉尼亚大学发布的Dream-RSI,走了一条更另类、也更克制的路:它完全不碰模型权重,只在探索策略这一层完成递归进化。底层那个写代码的智能体从头到尾没变过,变的是一段轻量级的、决定「下一步怎么搜」的编排代码。
这篇文章我不想复述论文的新闻稿,而是想把它的底层机制拆开讲透——它凭什么能用近乎零成本「做梦」,又凭什么说自己比传统 RSI 更安全。
一、核心洞察:一个已经跑完的发现过程,本身就是一台免费模拟器
要理解 Dream-RSI,得先理解它在「利用」什么资源。
当一个编码智能体去解一个难题(比如设计一个更快的 GPU 内核、一个更好的回归求解器)时,它走的不是一条直线,而是一棵搜索树。每一步,智能体提出一个候选方案,环境给出评估(跑测试、算得分、报诊断),智能体再决定下一步往哪走。论文把这个迭代过程称为「提议-评估循环」(propose-evaluate loop)。
关键在于:每一次尝试都会留下完整的执行轨迹——当时的文件系统快照、生成的代码、评估诊断、最终得分。这些轨迹不是散落的日志,而是按树状结构组织起来,构成了一棵发现树(discovery tree)。树上的每一个节点,都是一个「如果当初走这条路,会得到什么结果」的确定答案。
Dream-RSI 最锋利的一句话是:所有可能的结果已经被记录下来了。这意味着,一套新的探索策略,根本不需要重新运行任何代码。它只要沿着这棵已经存在的树,用不同的方式「遍历」——选不同的分支子集、以不同的顺序、采用不同的并行分组和止损决策——就能评估出「如果当时用这个策略,会搜出什么、花多少代价」。
这本质上是模型无关强化学习里**世界模型(world model)**的翻版:智能体在一个内部模拟环境里预演,而不是在真实环境里试错。区别在于,这个世界模型不是学出来的,而是「记录」出来的——是历史自己成了世界。论文的原话是:一个已完成的发现过程,其积累的历史记录本身就是一台免费的模拟器。
这里有一个必须说清的前提:回放模拟器的质量,取决于发现树的覆盖度。如果历史记录太稀疏,某些分支根本没被探索过,那模拟器对这个区域的表现就缺乏依据——它只能模拟「走过的路」,模拟不了「没走过的路」。这是后面要谈的局限,先记下。
二、三阶段闭环:在线探索 → 离线做梦 → 部署扩展
Dream-RSI 的运行是一个自我强化的循环,由三个阶段构成。
阶段一:在线探索与完整日志记录。当前策略驱动发现智能体去真正执行搜索任务,同时把每一轮「提议-评估」的轨迹完整记下来。这一阶段没有任何魔法,成本和传统搜索方法一样。
阶段二:模拟器构建与「做梦」。已经完成的发现树被转换成一个可复用的模拟器池。候选策略在这个池子里做「梦境」评估——也就是沿着历史记录遍历,模拟不同策略会如何导航同一片搜索空间。因为所有结果已经存在,评估只需要读取记录,不调用模型、不执行代码,成本接近于零。
阶段三:策略部署与循环扩展。在梦境里表现最优的策略,被重新部署回在线环境,去驱动下一轮真实搜索。而新一轮探索产生的新历史,又会被加进模拟器池,让池子越来越大、越来越能代表真实搜索空间。
整篇论文的杠杆点就压在阶段二上:它把最贵的部分——在线搜索,替换成了在历史记录上的离线回放。传统 RSI 想加速发现,得让模型更聪明(改权重,代价巨大且危险);Dream-RSI 加速发现,靠的是让「怎么搜」这件事被反复、廉价地优化。一次在线探索的代价,可以被之后无数次免费的梦境评估摊薄。
三、它在 RSI 谱系里的真实位置:策略层,而非权重层
要评价 Dream-RSI 的意义,得把它放进 RSI 的自主性坐标系里看。
研究者通常把 RSI 的自主性分成 L1 到 L5 五档:L1 执行人类指定的改进流程;L2 自主决定改进策略;L3 自主决定学习什么;L4 涉及部署与环境适应;L5 是对改进机制本身的递归修改。今天绝大多数系统停在 L2–L3。
Dream-RSI 占据的位置很微妙:它在 L2–L3 的策略层完成了递归,但明确不触碰 L5。被它递归改进的,只是一段轻量级的编排层 Python 代码——它决定每一轮从哪个节点继续、一次开启多少并行尝试、何时止损。而那个真正干活的底层编码智能体(论文用的是 Gemini 3.1 Pro 和 Gemini 3.7 Flash),在整个过程中权重完全不变。
这个区分在 RSI 的安全讨论里是重量的。传统 RSI 路线——让模型修改自身参数、或生成下一代模型——直接踩在 Anthropic 等机构反复警告的「失控」风险上:能力可能以超出人类理解的速度自我迭代。而 Dream-RSI 把递归限制在一个语义透明、可审计、可回滚的层面:探索策略的改进是在历史记录上离线完成的,它改变的是「搜索的调度方式」,不是「模型本身的能力」。
当然,这不意味着它没有安全含义。策略层的优化本身就能显著加速发现——162 倍的成本压缩,意味着同样预算下发现系统的迭代速度能提升两个数量级。当这种加速和前沿模型的能力结合,累积效应仍值得警惕。但它的可控性,和传统改权重路线不在一个量级。
四、实验结果:数量级级别的成本压缩
光有机制还不够,得看它省了多少。Dream-RSI 在三个技术领域做了验证。
算法工程(Lasso 正则化路径求解器)。它产出的求解器在六个留出数据集上优于 scikit-learn 和 glmnet 等标准库。相比此前最优的发现系统 SimpleTES,智能体调用次数从 51,200 次降到 317 次——约162 倍的减少;相比不改进策略的固定基线,也减少了约 1.7 倍。
数学优化(和差问题、自相关不等式、圆填充)。在达到或超过既有发现系统的同时,算力成本降低50 倍以上;其中圆填充问题的结果,追平了 Google 自家 AlphaEvolve V2 的最强纪录。
GPU 内核工程(基于 KernelBench)。在达到目标性能时,生成次数减少了 1.79 倍到 2.43 倍;或在相同预算下交付了最高 2.09 倍更快的内核。这一方向的收益相对温和,但方向一致。
怎么理解这个压缩?它不是因为模型变聪明了,而是因为「怎么搜」被优化了。同样的底层智能体、同样的算力上限,只是换了更会调度的策略,就把无效探索砍掉了两个数量级。这正是策略层 RSI 区别于权重层 RSI 的直接证据:能力边界没动,但边界内的探索效率被大幅拉伸。
五、最本质的一点:它优化的是「如何搜索」,不是「搜索什么」
讲完机制和结果,我必须泼一盆冷水——这也是理解 Dream-RSI 边界最该记住的一句话:它优化的是「如何搜索」,而非「搜索什么」或「如何推理」。
它让智能体在给定的能力边界内更高效地探索,但它不扩展这个边界本身。那个写代码的智能体还是只能写出现在能力范围内的代码,不会因为策略被递归改进就突然学会它原本不会的东西。真正的通用 RSI——系统能够改进自己的推理能力、学习效率、乃至改进机制本身——仍然不在这项工作的射程内。
更底层的几个开放问题也得摊开:
- 实证基础偏薄:论文是 8 个任务、3 个领域,样本量不大;而且没有报告「做梦」过程本身的墙上时钟耗时——省的是调用次数和算力预算,不是绝对时间。
- 模拟器有盲区:回放模拟器的质量依赖历史发现树的覆盖。树没覆盖到的区域,模拟器无从评估,策略可能在这些盲区里做出错误判断。
- 搜索 ≠ 智能:把「怎么搜」做到极致,解决的是效率问题,不是能力问题。一个不会某个任务的模型,再会搜也搜不出它能力之外的方案。
结语
Dream-RSI 的价值,不在于它「破解了 RSI」,而在于它重新定义了 RSI 的一个可行切面。当大多数讨论还困在「模型自我修改」的宏大叙事里时,它展示了一条更务实、更可控的路径:让系统学会如何更好地搜索,而不是改变系统本身。
历史即世界,策略即进化。这或许是递归自我改进,从理论思辨走向工程化的一个关键转折点——也提醒我们,通往更强 AI 的路,不一定非要从改权重开始。