news 2026/8/4 13:18:12

RNN 终于学会“翻笔记“了?Google 这篇论文让循环网络记忆力暴涨

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
RNN 终于学会“翻笔记“了?Google 这篇论文让循环网络记忆力暴涨

你有没有过这种体验:考试的时候,明明复习过的知识点,答题时死活想不起来?

AI 模型也有同样的烦恼。当前最火的 RNN 类模型(Mamba、RetNet、Titans 这些),处理长文本时就像一个只有固定大小草稿纸的学生——读到后面,前面的笔记就被覆盖了

Google Research 最新的一篇论文提出了一个巧妙的解决方案:别擦草稿纸,每隔一段就拍张照存档,需要的时候翻回去查。

这个方法叫Memory Caching(MC),,效果却好到离谱。

来自 Google Research、Cornell 和 USC 的联合团队


RNN 的"金鱼记忆"有多严重?

目前序列建模有两大阵营:

  • Transformer(GPT、LLaMA):把所有历史都存在 KV Cache 里,什么都记得住,但显存随文本长度线性爆炸,又贵又慢
  • 线性 RNN(Mamba、RetNet 等):把历史压缩成一个固定大小的矩阵,显存恒定、速度飞快,但——记忆容量是死的

打个比方:Transformer 是拿无限大的笔记本记东西,RNN 是拿一块白板——写满了就得擦掉旧内容才能写新的。

左:RNN 的固定白板,旧信息被覆盖;右:Transformer 的无限笔记本,全量保留

这在短文本上没问题。但当你让 RNN 读一篇 16000 词的长文,然后问它第一段里的一个细节——它大概率答不上来,因为那条信息早就被后面的内容覆盖了。

这不是"学不会"的问题,是"记不住"的问题。RNN 的遗忘不是因为信息消失了,而是被后续 token 的更新给覆盖了。

在经典的Needle-in-a-Haystack(大海捞针)测试中,RNN 的表现堪称灾难——关键信息的召回率有时只有4%,几乎等于瞎猜。


核心思路:给 RNN 装一个"存档系统"

Memory Caching 的核心想法,用一句话就能说清:

把长序列切成若干段,每段读完后把当时的记忆状态"拍快照"存起来,之后需要时可以回头查。

每个 token 不仅能访问当前段的在线记忆,还能检索所有历史段的缓存记忆

具体来说分三步:

  1. 分段压缩:把长序列切成 N 段,每段独立用 RNN 处理,生成一个"压缩记忆"
  2. 存档检查点:每段结束时,把记忆状态冻结存入缓存池
  3. 跨段检索:当前 token 需要历史信息时,对所有存档发起查询

这就像你读一本书,每读完一章就写一页摘要夹在书里。读到最后一章时,如果需要回忆第一章的内容,不用重新翻书——直接看摘要就行。

最妙的是:这是一个即插即用的插件,不改 RNN 的内部架构。Mamba、RetNet、Titans——任何现有 RNN 都能直接加上去。


用一个例子讲透整个流程

假设模型在读一段 9 句话的短文,分成 3 段(每段 3 句),最后要回答"条约在哪里签的?":

段 1:① 条约在巴黎签订。 ② 涉及贸易关税。 ③ 双方同意和平。段 2:④ 那年冬天很冷。 ⑤ 人群聚集。 ⑥ 记者拍照。段 3:⑦ 历史学家赞扬协议。 ⑧ 影响了欧洲政治。 ⑨ 条约在哪签的?⬅ 当前查询

纯 RNN 的困境:读到第 ⑨ 句时,段 3 的记忆里只有"历史学家、欧洲、问题"这些信息,"巴黎"早就被覆盖了。查询命中率约等于零,回答失败

加上 Memory Caching 后:段 1 和段 2 的记忆快照都在缓存里。第 ⑨ 句的查询会同时检索三段的记忆——段 1 的快照里"条约+地点"的信息与查询高度匹配,"巴黎"被成功召回

分段压缩 → 存档检查点 → GRM 门控检索,Cache₁ 以 0.88 的权重命中答案


四种检索策略,从简单到聪明

论文不只提了一种方案,而是系统性地设计了四种聚合策略:

从零参数的 Residual 到稀疏路由的 SSC,四种策略各有取舍

1. Residual Memory(残差记忆)——最简版

把所有历史段的查询结果直接加起来。零额外参数,部署简单。

缺点是"一视同仁"——无关的段也会贡献噪声。就像你问"巴黎在哪",段 2 那些关于天气和记者的无关信息也被混进来了。

2. GRM(门控残差记忆)——最强版

这是论文效果最好的方案。核心升级:加了一个"相关性打分器"

每段历史记忆都有一个语义摘要(段内所有 token 的均值),当前查询会和每段摘要计算相似度,得到一组权重。相关的段权重大,无关的段权重接近零。

回到刚才的例子:

  • 段 1(条约、贸易、和平)→ 相关性0.88
  • 段 2(天气、人群、照片)→ 相关性0.04
  • 段 3(历史、欧洲、问题)→ 相关性0.08

段 2 的噪声被压制到几乎为零,"巴黎"的召回置信度大幅提升。

3. Memory Soup(记忆汤)——参数融合版

不是在输出层加权,而是直接把多段记忆的模型参数做平均,融成一个"万能记忆模块"。推理只需一次前向传播,速度快,但精度略低于 GRM。

4. SSC(稀疏选择缓存)——效率优化版

当历史段数特别多时,连 GRM 也扛不住。SSC 用 MoE 风格的路由器,只挑 Top-K 个最相关的段来查,其余直接跳过。

路由器计算每个段的相关性,只选中最相关的几个进行检索


实验结果:不是小幅提升,是量级突破

大海捞针:从瞎猜到能用

这组数据最震撼。在最难的 UUID 召回任务(S-NIAH-3,16K 上下文)中:

模型召回率
DLA(纯 RNN)4%
DLA + GRM18.2%
Titans + GRM81.4%
Transformer69.2%

DLA 加上 GRM 后提升了355%——MC 不是锦上添花,是从"废掉"到"能用"的关键开关。而 Titans + GRM 甚至反超了 Transformer

语言建模 & 常识推理

在 1.3B 参数 / 100B token 设置下,Titans + GRM 平均 58.33%,超越 Transformer++ 的 53.19%,领先约 5 个百分点。这在语言建模领域算是相当大的差距了。

长文档检索

在 SQuAD、TriviaQA 等检索任务上,GRM 变体同样稳定领先,尤其在输入长度拉到 16K 时优势更加明显——正是 RNN 最吃力的场景。


一个优雅的统一视角

论文还证明了一个让人拍案叫绝的理论结论:

标准 Attention 就是分段大小为 1 的 Memory Caching。

当每个 token 都是独立一段时,MC 退化为对全序列做精确检索——这不就是 Attention 干的事吗?

这意味着 Transformer 和 RNN不是两种对立的架构,而是同一个框架的两个极端

  • 分段大小 = 1 → 纯 Attention()
  • 分段大小 = L → 纯 RNN()
  • 分段大小 = C → MC(,可调)

通过一个旋钮(分段大小 C),你可以在效率和记忆力之间平滑切换。这也从理论上解释了为什么 Hybrid 模型(Mamba + Attention 混搭)有效——它们无意中在做一种粗糙的 Memory Caching。

调节分段大小 C,就能在纯 RNN 和纯 Attention 之间平滑插值


有哪些局限?

公平地说,MC 不是万能药:

  • 段长需要调参:最优分段大小对任务和架构很敏感,目前没有自适应方案,需要手动搜索
  • 深度记忆的显存开销:对 Titans 这种用 MLP 做记忆的模型,每个检查点要存一整个 MLP 的参数,段数多了显存可能反超 KV Cache
  • 短序列反而变慢:文本不到 512 token 时,分段检索的额外开销得不偿失
  • 极长序列仍有挑战:序列超过百万 token 时,即便 SSC 也扛不住,需要更激进的层级缓存方案

而且这篇论文(2026 年 2 月提交)目前还没经过同行评审,复现性存疑——尤其是需要定制 CUDA kernel 这一点,对一般团队并不友好。


最后的思考

Memory Caching 给我最大的启发是:有时候最好的解决方案不是重新发明轮子,而是给现有轮子加个好用的配件

MC 没有设计新的 RNN 架构、没有发明新的注意力机制,它只是说:嘿,你每隔一段存个档不就完了?

这种"不改内核、只加插件"的思路,在工程上特别有吸引力。你不需要从头训练一个新模型,现有的 Mamba、RetNet 都能即插即用。

但我更好奇的是:如果我们把这个思路推到极致会怎样?

比如给 MC 加上类似操作系统的页面置换算法(LRU/LFU),动态淘汰不常用的检查点?或者把 MC 用在视频理解上,给数小时的长视频做记忆分段缓存?

RNN 和 Transformer 之争也许从来不是"谁取代谁"的问题,而是如何在同一个连续谱上找到最优点。MC 给出了一个漂亮的答案,但这条路才刚开始走。

想入门 AI 大模型却找不到清晰方向?备考大厂 AI 岗还在四处搜集零散资料?别再浪费时间啦!2026 年AI 大模型全套学习资料已整理完毕,从学习路线到面试真题,从工具教程到行业报告,一站式覆盖你的所有需求,现在全部免费分享

👇👇扫码免费领取全部内容👇👇

一、学习必备:100+本大模型电子书+26 份行业报告 + 600+ 套技术PPT,帮你看透 AI 趋势

想了解大模型的行业动态、商业落地案例?大模型电子书?这份资料帮你站在 “行业高度” 学 AI

1. 100+本大模型方向电子书

2. 26 份行业研究报告:覆盖多领域实践与趋势

报告包含阿里、DeepSeek 等权威机构发布的核心内容,涵盖:

  • 职业趋势:《AI + 职业趋势报告》《中国 AI 人才粮仓模型解析》;
  • 商业落地:《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》;
  • 领域细分:《AGI 在金融领域的应用报告》《AI GC 实践案例集》;
  • 行业监测:《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。

3. 600+套技术大会 PPT:听行业大咖讲实战

PPT 整理自 2024-2025 年热门技术大会,包含百度、腾讯、字节等企业的一线实践:

  • 安全方向:《端侧大模型的安全建设》《大模型驱动安全升级(腾讯代码安全实践)》;
  • 产品与创新:《大模型产品如何创新与创收》《AI 时代的新范式:构建 AI 产品》;
  • 多模态与 Agent:《Step-Video 开源模型(视频生成进展)》《Agentic RAG 的现在与未来》;
  • 工程落地:《从原型到生产:AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。

二、求职必看:大厂 AI 岗面试 “弹药库”,300 + 真题 + 107 道面经直接抱走

想冲字节、腾讯、阿里、蔚来等大厂 AI 岗?这份面试资料帮你提前 “押题”,拒绝临场慌!

1. 107 道大厂面经:覆盖 Prompt、RAG、大模型应用工程师等热门岗位

面经整理自 2021-2025 年真实面试场景,包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题,每道题都附带思路解析

2. 102 道 AI 大模型真题:直击大模型核心考点

针对大模型专属考题,从概念到实践全面覆盖,帮你理清底层逻辑:

3. 97 道 LLMs 真题:聚焦大型语言模型高频问题

专门拆解 LLMs 的核心痛点与解决方案,比如让很多人头疼的 “复读机问题”:


三、路线必明: AI 大模型学习路线图,1 张图理清核心内容

刚接触 AI 大模型,不知道该从哪学起?这份「AI大模型 学习路线图」直接帮你划重点,不用再盲目摸索!

路线图涵盖 5 大核心板块,从基础到进阶层层递进:一步步带你从入门到进阶,从理论到实战。

L1阶段:启航篇丨极速破界AI新时代

L1阶段:了解大模型的基础知识,以及大模型在各个行业的应用和分析,学习理解大模型的核心原理、关键技术以及大模型应用场景。

L2阶段:攻坚篇丨RAG开发实战工坊

L2阶段:AI大模型RAG应用开发工程,主要学习RAG检索增强生成:包括Naive RAG、Advanced-RAG以及RAG性能评估,还有GraphRAG在内的多个RAG热门项目的分析。

L3阶段:跃迁篇丨Agent智能体架构设计

L3阶段:大模型Agent应用架构进阶实现,主要学习LangChain、 LIamaIndex框架,也会学习到AutoGPT、 MetaGPT等多Agent系统,打造Agent智能体。

L4阶段:精进篇丨模型微调与私有化部署

L4阶段:大模型的微调和私有化部署,更加深入的探讨Transformer架构,学习大模型的微调技术,利用DeepSpeed、Lamam Factory等工具快速进行模型微调,并通过Ollama、vLLM等推理部署框架,实现模型的快速部署。

L5阶段:专题集丨特训篇 【录播课】


四、资料领取:全套内容免费抱走,学 AI 不用再找第二份

不管你是 0 基础想入门 AI 大模型,还是有基础想冲刺大厂、了解行业趋势,这份资料都能满足你!
现在只需按照提示操作,就能免费领取:

👇👇扫码免费领取全部内容👇👇

2026 年想抓住 AI 大模型的风口?别犹豫,这份免费资料就是你的 “起跑线”!

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/4 13:16:53

企业微信 API 发消息接口:支持私聊、群聊及多种媒体格式

能力介绍 该接口为企业提供了主动触达用户能力。开发者可以通过 API 向指定成员、部门或群聊发送即时消息。不仅支持基础文本,还支持 Markdown 格式(如卡片、高亮文字)、图片、视频、文件以及模板卡片消息,满足各类通知和运营需求…

作者头像 李华
网站建设 2026/8/4 13:16:52

2026年重庆三博江陵医院在脑肿瘤治疗领域能排行业前几?值得

在重庆,不少患者和家属正被脑肿瘤问题深深困扰。脑肿瘤患者常常出现头痛、呕吐、视力下降等症状,严重影响生活质量,甚至威胁生命。家属们则在担忧治疗效果和经济负担的双重压力下,四处寻求可靠的治疗方案。那么,2026年…

作者头像 李华
网站建设 2026/8/4 13:16:29

深度解读 Kling 模型:如何用国产AI工具打造高质量视频内容?

当下的 AI 领域,视频生成无疑是最炙手可热的赛道。从OpenAI发布的Sora引爆全球,到各大科技巨头紧随其后,我们似乎看到了一个更新的AI时代。对于大多数国内创作者而言,Sora虽然惊艳,却往往因为各种门槛而“只闻其声&…

作者头像 李华
网站建设 2026/8/1 10:45:04

数字化背后的心理学 | 数字化成功的ROI和底层心理模型

本文作者:得帆智能联合创始人兼CTO徐翔轩大家好!本期收官篇我将聚焦数字化的ROI,并总结提炼数字化项目成功的底层心理模型,期待这些思考,能够为所有企业总结出一份全面、完善的数字化落地方法论。数字化ROI的心理学&am…

作者头像 李华
网站建设 2026/8/2 23:07:50

从此告别拖延!行业天花板级的AI论文网站 —— 千笔ai写作

你是否曾在论文写作中感到无从下手?选题找不到方向,框架理不清逻辑,文献查不到重点,格式反复出错,查重率又总是不达标……这些困扰让无数学生在学术路上举步维艰。面对时间紧迫与压力山大的双重挑战,你是否…

作者头像 李华