news 2026/9/26 0:28:04

让AI看视频时不再健忘:LatentStream如何把记忆真正“内化“进大脑

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
让AI看视频时不再健忘:LatentStream如何把记忆真正“内化“进大脑

你有没有遇到过这种情况:跟一个人聊了很久的事情,对方却记不住上下文,你每次提问都要重新把背景交代一遍。这种感觉挺累的,对吧?

现在的AI在看视频时,也在经历类似的困境。

想象一台监控摄像头,接了一个AI模型,让它实时理解画面里发生的事情。视频一直在播,画面一帧接一帧涌进来,AI不可能把每一帧都完整存下来,内存会爆掉。所以现有的做法是:把看过的画面压缩存进一个"记忆仓库",等用户提问了,再从仓库里翻出相关的几张画面,重新塞给AI去理解。

这套思路听起来挺合理,问题出在哪呢?

**这个仓库里存的东西,始终是外部的、临时的视觉材料,AI每次回答问题都要重新翻找、重新读取,它从来没有真正把这些历史信息"记在脑子里"过。**

这就好比你每次要用一个知识点,都得翻书查阅,而不是把它真正理解并记在脑子里。翻书当然能用,但如果不把知识内化成自己的理解,你永远无法把新旧信息串联起来做深层推理,只能停留在"查到什么就说什么"的层面。如果AI一直靠"查资料"而不是"记脑子里",它就永远无法形成连贯、逐步深化的理解,每次提问都是从零开始检索,信息用完就扔,下一轮又要重新翻。

这就是南京理工大学、蚂蚁集团、新加坡国立大学等机构联合提出的LatentStream要解决的核心矛盾。他们给这套系统起了个很直白的名字,从"存储再检索"转变为"检索并内化"。

视频记忆的三层仓库:不是所有历史都值得同等对待

先说说AI怎么管理这些不断涌入的视频画面。

*流式视频理解*:指AI模型需要连续处理正在播放的视频画面,并能随时回答用户提出的问题,而不是等视频播完再统一分析。

LatentStream的第一步,叫做*查询无关的分层流式记忆*:在用户提问之前,系统就已经按时间远近,把视频画面分成短期、中期、长期三层记忆库进行组织和压缩。

这个设计的道理其实很朴素。刚发生的事情,细节要保留得清楚一点,因为大概率会被问到;发生得越久远,信息就该越粗略,因为大部分细节已经不重要了。这跟人脑记忆的规律几乎一模一样,你能清楚记得十分钟前吃了什么,但一个月前某天下午三点发生的事,除非特别重要,早就模糊成一个大概印象了。

问题是,"多久算旧"这个界限该怎么划?如果用一个固定的时间阈值,比如"超过30秒就归为中期记忆",那在信息变化剧烈的片段(比如一场激烈的球赛)和信息平缓的片段(比如一个人静坐看书)里,这个阈值的效果完全不一样。

LatentStream用了一个叫*Jenks自然断点法*的统计工具来解决这个问题:这是一种能根据数据本身的分布特征,自动找出"分组断点"的统计方法,而不是人为设定一个固定的阈值。

具体来说,系统会给每个视觉片段计算一个"时间重要性分数",衡量这段画面和相邻画面比起来有多大变化。变化大,说明有新事件发生,值得保留细节;变化小,说明画面基本没变,可以压缩甚至丢弃。Jenks方法会根据这些分数本身的分布,自动找出两个断点,把画面分成"丢弃、压缩、完整保留"三类。到了中期记忆过渡到长期记忆时,系统又用类似的方法,把空间上相似的画面块合并起来,进一步压缩体积。

这套机制的好处在哪?如果不这样做,用固定规则去裁剪历史,遇到运动激烈的视频段就会把有用信息切掉太多,遇到平静的视频段又会存下大量冗余。实验数据显示,仅这一步分层记忆管理,就能把OVO-Bench基准的得分从54.0%拉到58.1%,VideoMME从63.3%拉到65.1%。这只是第一步,效果已经相当可观了。

让"记忆令牌"自己去翻历史,越翻越准

有了分层的历史仓库,接下来的问题是:用户提问之后,怎么把相关的历史信息真正"吸收"进AI的思考过程里,而不是简单地当作参考资料贴在旁边?

这里LatentStream引入了一个核心概念,叫*潜在记忆令牌*(Latent Memory Tokens,简称LMT):这是一组可以被优化、能主动去检索历史信息、并不断更新自己内容的特殊向量,它们存在于模型的内部表示空间(也就是"潜在空间")里,而不是普通的文字或图像。

这组令牌被分成三组,分别对应短期、中期、长期三层记忆,每一组能"看到"的历史范围逐渐扩大。短期组只能看最近的记忆,中期组能看短期加中期,长期组能看到全部三层。

这个设计巧妙之处在于,它模拟了人回忆事情时的自然过程。你回想一件事的时候,往往不是一次性把所有相关记忆都调出来,而是先想起最近发生的线索,再顺着这个线索往前追溯,范围越扩大,想起的细节也越多。就好比警察破案,先看监控里最近的画面找线索,发现线索后再去查更早的录像,一步步扩大排查范围,而不是一开始就把过去一整年的录像全倒出来看,那样反而会被无关信息淹没,找不到重点。

这三组令牌不是一次性检索完就结束的,而是要经过多轮"检索—更新"的循环。每一轮,每组令牌都会从自己对应的记忆范围里,挑出和自己最相关的几段历史证据(用余弦相似度衡量),把这些证据"注入"进来,跟令牌本身一起参与到模型的一次前向计算里,然后再根据结果决定这次检索的证据要不要保留下来,继续用于下一轮。

这里有一个细节值得单独说一下:新检索到的证据不是无条件被接受的,只有当它能让整体的"信心"指标(下一节会讲)真正提升时,才会被并入长期保留的证据池,否则就被丢弃。

这个"择优保留"的机制其实很关键。如果不设这个门槛,检索到的证据不管好坏全部塞进去,模型很容易被无关信息带偏,就像开会时如果谁的发言都要记进会议纪要,纪要最后会变得又长又乱,真正重要的决定反而被淹没。设置门槛之后,只有真正有价值的信息才会留下来,记忆内容始终保持精炼。

用"AI自己的信心"当老师,不需要标注答案

前面说的检索和更新循环,靠什么信号来判断"这一轮做得好不好"?这是LatentStream最有意思的部分。

答案是:不需要人工标注正确答案,而是让模型自己的预测置信度当反馈信号。

*预测熵*:衡量模型对下一步输出结果的不确定程度,熵越低,说明模型对答案越有把握;熵越高,说明模型犹豫不决,好几个答案的概率都差不多。

具体做法是,对短期、中期、长期这三组令牌,分别计算它们在当前状态下的预测熵。因为三组令牌看到的历史范围是逐层扩大的,直觉上,看到的历史信息越全面,模型应该越有把握做出判断,也就是熵应该逐层降低:短期组的熵最高,长期组的熵最低。

这就构成了一个叫*层级递进奖励*的优化目标,它由两部分组成,一部分是"绝对信心",鼓励每一组令牌本身的熵都尽量低;另一部分是"层级递进",专门奖励熵值确实按短期到长期的顺序递减的情况,如果某一组的熵反而比该更自信的那一组还高,就会被扣分。

这套机制解决了什么问题?光靠"绝对信心"这一项是不够的,因为它只会让每一组独立地朝着自信的方向走,却没有约束这几组之间该有的逻辑关系,检索到更多历史信息、看到更全面的证据,理应带来更强的把握,如果这个递进关系没被鼓励,模型很可能出现"看得越多反而越糊涂"的反常状态,这在实验里也确实被验证了:只用绝对信心优化,OVO-Bench是62.5%,VideoMME是65.5%;加上层级递进的约束之后,分别提升到64.2%和66.6%。

这就好比考试复习,如果一个学生只追求"每一科都要自信",他可能会在简单题上刷高信心,难题上随便应付。真正好的学习状态应该是,随着复习资料看得越多、理解越深,对整道题的把握应该越强,而不是复习了半天反而更糊涂。层级递进奖励做的正是这件事,它逼着模型的信心随着信息量的增加而真正增长,而不只是虚假地在每个孤立环节里显得自信。

有了这个奖励信号,系统用一种叫*REINFORCE的策略梯度方法*来更新令牌和检索到的证据表示:这是一种通过对参数加入随机扰动、观察扰动前后奖励的变化、再据此调整参数方向的优化技术,整个过程不需要修改AI模型本身的任何参数,只优化这些额外插入的记忆令牌。

优化完成之后,检索用的临时证据会被移除,最终回答只依据压缩后的分层记忆、用户提问、以及这些已经吸收了历史信息的记忆令牌来生成。历史信息不再是外挂的参考资料,而是被真正"消化"进了模型思考的内部状态里。

数字说话:省内存、还更准

这套设计到底效果如何?论文在多个基准上做了详尽验证。

在流式视频理解的OVO-Bench上,基于Qwen2.5-VL-7B模型,LatentStream把整体得分从基线的54.0%提升到64.2%,涨了10.2个百分点。细拆开看,实时视觉感知这一项从63.3%涨到68.5%,而"回溯追踪"(需要回忆更早发生的事件)这一项,涨幅特别惊人,从44.7%直接跳到60.0%,涨了超过15个百分点。这恰恰印证了前面说的逻辑:越需要调用长期历史记忆的任务,这套"检索并内化"的机制带来的提升就越明显。

在StreamingBench上,LatentStream拿到76.9%,超过了所有对比过的免训练方法。而在三个离线长视频理解基准VideoMME、MLVU、LongVideoBench上,尽管这套系统本来是给流式场景设计的,也依然拿下了66.6%、74.0%、62.1%的成绩,比基线分别提升3.3、6.1、1.4个百分点,说明这套记忆内化机制的价值不局限于"实时"这一个场景。

效率方面也有意外的收获。原本你可能会担心,加了这么多轮检索和优化,计算成本肯定飙升。但实测下来,LatentStream把峰值显存从30.80GB降到21.97GB,每个输出token的解码时间从6.45毫秒降到3.16毫秒,速度提升了一半以上。原因在于,压缩后的分层记忆大幅减少了需要在生成阶段反复处理的视觉上下文长度。当然,代价是首字延迟从7.63秒增加到8.41秒,因为多轮记忆演化本身需要额外的推理时间,这是一个合理的权衡:多花不到一秒钟去"想清楚",换来后续每一步回答都更快、更省资源。

论文里还做了一组对比实验,很能说明问题。如果只是简单地把检索到的视觉证据拼接进上下文(不经过令牌内化这一步),OVO-Bench只能到59.7%;如果只加入未经优化的初始记忆令牌,反而降到56.5%,比基线还差;只有经过完整演化优化的记忆令牌,才能达到64.2%。这说明性能提升不是因为"多塞了点信息"这么简单,而是那个"内化并演化"的过程本身在起作用。

写在后面

读完这篇论文,最触动我的一点是,它其实在质疑一个我们过去几年都默认合理的假设:给AI装个检索模块,让它按需去查资料,这就够了。

但检索这件事,本质上是"外部知识库+按需调用"的模式,跟人真正学会一个东西是不一样的。你能查到一个知识点,和你把这个知识点内化成自己的理解、能在后续推理里灵活调用它,是两种完全不同的认知状态。LatentStream把这个区分第一次明确地做进了流式视频理解这个具体任务里,而且拿出了具体的数字来证明这个区分是有意义的,比如那15个百分点的"回溯追踪"能力提升。

还有一点让我意外,这套系统完全没有修改底层大模型的任何参数,靠的全是在推理阶段对几个额外插入的"记忆令牌"做优化。这意味着同样的思路理论上可以套用到任何现成的视频语言模型上,不需要重新训练一遍。这种"轻量插件式"的改进思路,如果推广开来,可能会比"训一个更大的模型"更实用。

论文里没细说的一个问题是,这套机制在面对更长、更复杂的多轮对话场景(不是单次提问,而是连续追问)时会怎样演化,记忆令牌能不能在多轮交互里持续积累而不"饱和"或"遗忘",这个问题留给了后续研究。

如果AI真的能做到把看过的东西"记在心里"而不是"存在硬盘里再翻",那它离真正理解这个世界,又近了一步吗?

Q&A

Q1:LatentStream是什么?

A:LatentStream是一个面向流式视频理解的框架,它把AI处理视频历史信息的方式从"存储再检索"转变为"检索并内化",让历史证据被真正吸收进一个紧凑的潜在记忆状态,持续指导后续推理,而不是简单地作为外部参考资料贴在旁边。

Q2:LatentStream需要重新训练AI模型吗?

A:不需要。LatentStream在推理阶段工作,只优化额外插入的潜在记忆令牌,底层视频语言模型的参数完全保持冻结,因此可以直接套用在现成的Qwen2.5-VL等模型上。

Q3:LatentStream相比之前的方法效果提升有多少?

A:在OVO-Bench上整体得分从54.0%提升到64.2%,其中依赖长期回忆的"回溯追踪"任务提升超过15个百分点;同时显存占用从30.80GB降到21.97GB,解码速度提升超过一半。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/26 0:26:03

MySQL与C#实战:房屋租赁管理系统数据库课程设计全流程解析

简介:一份面向高校数据库课程设计与毕业设计的房屋租赁管理系统完整源码包,基于C#与MySQL实现,适合正在完成管理信息系统类课题的学生作为参考。系统涵盖房屋信息、租客合同、费用结算等常见业务模块,可帮助理解C# WinForms界面开…

作者头像 李华
网站建设 2026/9/26 0:17:54

Clawdbot 配置豆包1.8模型:settings.json 骨架与连通性验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/26 0:13:12

UE5多人FPS网络同步实战:客户端预测与服务器回滚机制详解

1. 多人FPS网络同步的整体设计思路1.1 为什么FPS游戏的网络同步这么难做UE5的多人FPS网络同步,说白了就是让几个甚至几十个玩家在各自的屏幕上看到大致一样的战场画面,同时保证每个人的操作都能被服务器认可并广播给其他人。这件事听起来简单&#xff0c…

作者头像 李华
网站建设 2026/9/26 0:10:50

华为昇腾Atlas 300V推理卡上部署YOLOv5全流程详解

“atlas”这个项目标题配合上热搜词来看,明显是指华为昇腾的Atlas系列。不少朋友在二手平台看到“Atlas 300V 24G”,第一反应是“这玩意是不是个大显存的运算加速卡,能不能捡漏”。这个问题的答案,对也不对。说它对,因…

作者头像 李华