一份来自 2026 年 8 月 3 日的「AI Agent 记忆操作系统」深度报告 Skill:MindMemOS | 作者:华为诺亚方舟实验室 | 协议:MIT GitHub:GitHub - mindscale-noah/MindMemOS · GitHub | 官网:https://mindmemos.cn
一句话总结
MindMemOS 是华为诺亚方舟实验室刚开源的「AI Agent 记忆操作系统」。它把记忆从单一 Agent 中剥离,用「实体—属性—时间」三维结构重建长期记忆,并首创「Dreaming 离线整理」+「Feedback 反馈强化」+「Skill 自演进」三大机制,让 AI 在跨会话、跨应用、跨框架的情境下还能记住你是谁、踩过什么坑、擅长做什么事。
在公认难的 LoCoMo 长对话记忆基准上拿下94.03 分 SOTA,PersonaMem 长期个性化70.63%,比同期最强基线还高几个身位。
一、为什么是 MindMemOS?——Agent 用了都说「健忘」的故事
上周三凌晨 12 点,我给 Claude Code 连续提了 8 个任务:
- 第 1 个:帮我建一个 Python 工程模板,配 pytest、ruff、uv
- 第 3 个:在模板里加上 SQLAlchemy + Alembic
- 第 5 个:把 pytest 改成 asyncio 模式
- 第 7 个:再加一个 FastAPI demo
- 第 8 个:「上次你帮我建的那个工程模板,能加上 Redis 缓存吗?」
AI 一脸懵:「抱歉,我没有之前的上下文,请告诉我项目结构。」
我直接裂开——上一秒它还在帮我写 alembic,下一秒就失忆了。
这不是我一个人遇到的问题。在 quantum bit(量子位)最近的开发者调研里,78.4% 的 Agent 重度用户把「记忆丢失」列为第一痛点,比「幻觉」还高 11 个百分点。
为什么?
答案很扎心:2025 到 2026 年,AI Agent 的能力在工具调用上突飞猛进,但在「记忆」这件事上,依然是各自为战的孤岛——
| 痛点 | 现状 |
|---|---|
| 记忆带不走 | 换一个 Agent、换一个会话、换一个框架,就得重新「养」一遍 |
| 视角千差万别 | 客服 Agent 关注「投诉记录」,编程 Agent 关注「代码偏好」,无法用一套模板搞定 |
| 记忆不会成长 | 提取、检索、组织策略写完就固化,无法从用户纠错中持续演进 |
| 缺时间维度 | 只记「现在的事实」,丢了「为什么改主意」、「原来是 X,怎么变成 Y」 |
8 月 3 日,华为诺亚方舟实验室正式开源 MindMemOS——专门治这个病。
它上来就把口号喊得很明确:不是再做一套 Mem0/MemoryBank,而是给 Agent 装一个独立的「记忆操作系统」。
二、MindMemOS 到底是什么?——一文讲透三个核心架构
很多读者可能会疑惑:市面上的长期记忆框架已经有 Mem0、Letta(以前叫 MemGPT)、Cognee、Memary、MemoryBank……华为这套又有什么不一样?
核心区别是一句话:MindMemOS 是「操作系统」级别的抽象,而不是「插件」级别的封装。
它把 Agent 的记忆拆成三层独立架构,并且设计了三大在线/离线机制。
2.1 三层独立架构
┌─────────────────────────────────────────────┐ │ 接入层(Agent Adapters) │ │ ├─ OpenClaw / Claude Code 插件 │ │ ├─ FastAPI HTTP 接口 │ │ ├─ Python SDK / CLI │ │ └─ MindScale Skills(SaaS) │ ├─────────────────────────────────────────────┤ │ 算法层(Memory Algorithms) │ │ ├─ MindVanilla(开域,无模板抽取) │ │ ├─ MindSchema(按领域预设实体属性) │ │ ├─ Compact Search(外层 Agentic + 内层多路径) │ │ ├─ Dreaming(离线整理、冲突消解) │ │ └─ Feedback(显式/隐式信号回流) │ ├─────────────────────────────────────────────┤ │ 结构层(Memory Structure) │ │ └─ 「实体(Entity)— 属性(Property)— 时间(Time)」三维建模 │ └─────────────────────────────────────────────┘为什么是三层独立?
因为记忆是「跨 Agent 资产」,不应该被某一家 LLM 厂商、某一个框架锁死。三层独立之后:
- 一个 OpenClaw 用户今天用 DeepSeek 写的代码,明天切到 Claude Code,记忆照样能用
- 一家公司内部 5 个 Agent 共享同一份「客户档案」,不再各自重建
而传统方案,比如直接把记忆塞到向量数据库里,本质上是把记忆和算法绑死——换个 LLM 就要重训 embedding 模型,换个 Agent 框架就要重写解析逻辑。
2.2 三大核心机制
① 实体-属性-时间 三维建模(MindSchema)
传统长期记忆:把对话切成文本片段或向量 chunk。
MindMemOS:用一个三维结构描述世界信息流。
实体(Entity) → 人、项目、文件、工具、组织 属性(Property) → 名字、状态、偏好、高阶特征 时间(Time) → 这个属性「什么时候成立」「什么时候变化」举例:「用户以前偏好 X,现在改用 Y」——传统记忆会变成两条互不相干的文本片段;MindMemOS 把它们放在同一实体同一属性的时间轴上,你能直接看到 6 个月前的偏好怎么变成今天的偏好。
两条抽取路径:
- MindVanilla:无需预设模板,对话/文本/工具执行轨迹直接入库(适合开域)
- MindSchema:先规定「这个领域关注哪些实体和属性」,再切分话题、做属性级记忆生成、等价实体融合、图结构合并(适合垂直域)
② Dreaming:让 Agent 在「空闲时间」整理记忆
人类睡觉时会做梦——大脑会把当天冗余、冲突、过时的记忆合并、归档、形成抽象规律。
MindMemOS 的Dreaming 模块正是这个角色:
离线阶段扫描活跃记忆 ↓ 围绕相关实体局部扩展 ↓ 识别重复 / 冲突 / 演化 ↓ 执行:合并冗余 / 归档旧事实 / 补充关系 / 发现新模式 ↓ 把整理结果写入持久记忆(不靠每次回答时再判)MindMemOS 在 MemoryAgentBench FactConsolidation 子集上验证:在把19.4%—23.5% 活跃记忆转入归档(即主动遗忘)的同时,Single-hop 与 Multi-hop 问答准确率最高提升 10.3 个百分点。
少即是多——主动遗忘,本身就是记忆质量的一部分。
③ Feedback:用户的一次纠正,不能只修一条答案
Dreaming 是系统主动整理,Feedback 是让用户纠错信号回流。
MindMemOS 同时支持两种反馈:
- 显式:用户直接说「这条记忆错了,应该是 Y 而不是 X」
- 隐式:在后续对话中表达不满、纠正偏好、隐性修正
系统会判断这条信号属于:
- 当前任务临时信息 → 直接丢弃
- 特定场景偏好 → 长期保留
- 普遍规律 → 强化甚至迁移到「策略层」
更关键的是:Feedback 不只是改一条记忆,而是反向修改「记忆提取 + 检索 + 组织」整套策略。
论文 PersonaMem-Evo 案例:用户说「我偏好临时约见」——
- 改之前:系统只记这条表层信息 → Top-10 召回 1 条模糊记忆 → 推荐「结构化群体活动」(错)
- 改之后:系统从多轮交互中识别出「喜欢临时或当天计划,担心长期计划有变」+「社交场景边界」 → Top-10 召回 3 条一致记忆 → 推荐「自发一对一活动」(对)
④ Skill Evolution:把 Skill 从「静态文档」升级为「可演进资产」
这是 MindMemOS 最具想象力的部分——
传统 SKILL.md 是写完就不动的:
# Spreadsheet Skill ## 用 openpyxl 打开工作簿 ## 用 ws.append() 添加数据MindMemOS 让它可以根据真实执行轨迹持续进化:
真实任务轨迹(add → search → dream → evolve 闭环) ↓ 提取目标、关键转折、工具使用、最终结果 ↓ 聚合反复成功的策略 + 反复出现的失败 ↓ 生成针对当前 SKILL.md 的修改计划 ↓ 应用编辑,生成新版本 ↓ 同步回后续任务两种模式:
- MindEvolve-Unsup:纯靠执行轨迹无监督演进
- MindEvolve-Sup:有评分后做强化学习式演进
论文在 400 个真实 Excel 任务的 SpreadsheetBench-Verified 上跑出:
| 模式 | 任务成功率 | 对比基线 |
|---|---|---|
| No-skill | 51.3% | — |
| Init-skill(未演进) | 48.0% | 反而比 No-skill 低 3.3%⚠️ |
| MindEvolve-Unsup | 55.3% | +4% / +7.3% |
| MindEvolve-Sup | 57.2% ± 2.4% | +5.9% / +9.2% |
注意一个爆炸性发现:未经优化的 Init-skill 居然比 No-skill 还差——因为它给 Agent 一份「看似有但其实有错」的规则,反而制造干扰。
这也解释了为什么很多团队把 Skill 装上之后发现没效果——Skill 不演进,不如不装。
三、性能炸裂——三项基准全 SOTA
3.1 LoCoMo(长对话记忆基准)
LoCoMo 包含 10 组超长多会话对话(每组可达 30+ 轮),考验 Agent 在「跨数十次对话」的长期事实召回能力。
MindMemOS 使用 gpt-4.1-mini 作为回答模型,整体配置对齐 EverOS。
结果:MindMemOS-Modeling 拿到 94.03 分 Overall Accuracy,成为所有对比方法的最高结果。
横向对比(部分数据):
- Mem0、Letta、Cognee、MemoryBank、A-Mem 等主流方案:最高 89.x
- MindMemOS-Modeling:94.03(断崖式领先)
3.2 PersonaMem(长期个性化基准)
PersonaMem 考验「用户画像 + 个性化推荐」的精准度。
- MindMemOS-MindSchema:70.63%(最高)
- MindMemOS-MindVanilla:67.74%
- Baseline:65.5%
3.3 SpreadsheetBench-Verified(Skill 演进效果)
之前说过:No-skill 51.3%、Init-skill 48.0%、MindEvolve-Unsup 55.3%、MindEvolve-Sup 57.2% ± 2.4%。
这意味着同样一份 SKILL.md:未经演进比不装还差,经过演进比不装提升 11.5%。
四、安装与上手——三分钟跑通一个 MindMemOS Demo
4.1 最快路径(云服务)
MindMemOS 云服务已开放注册,Star GitHub 仓库即可获得更多使用额度。
# 1. 访问官网注册 open https://mindmemos.cn # 2. 拿到 API Key export MINDMEMOS_API_KEY="mm_your_key" # 3. 安装 Python SDK pip install mindmemos4.2 本地部署(完整开源栈)
# 1. 克隆仓库 git clone https://github.com/mindscale-noah/MindMemOS.git cd MindMemOS # 2. 一键启动(Docker Compose) docker-compose up -d # 3. 验证服务 curl http://localhost:8000/health # {"status": "ok", "version": "0.3.0"} # 4. 调用 add API 写入第一条记忆 curl -X POST http://localhost:8000/api/v1/add \ -H "Content-Type: application/json" \ -d '{ "entity": "user_19441", "property": "programming_style", "time": "2026-08-06", "value": "用户偏好函数式 Python,反对 OOP" }' # 5. 调用 search API 检索 curl -X POST http://localhost:8000/api/v1/search \ -H "Content-Type: application/json" \ -d '{"query": "用户喜欢什么代码风格?"}' # 返回结构化的「实体-属性-时间」记忆列表4.3 接入你的 OpenClaw Agent
MindMemOS 官方提供了 OpenClaw 插件:
clawhub install mindmemos export MINDMEMOS_API_KEY="mm_your_key" # 在 openclaw config.yaml 添加 channels: memory: provider: mindmemos user_id: user_19441之后,每次你和 Agent 对话,它都会自动写入 MindMemOS;下次开新会话,Agent 自动从 MindMemOS 召回相关记忆。
五、MindMemOS vs 同类——它到底强在哪?
和目前主流长期记忆方案对比:
| 维度 | Mem0 / Letta / Cognee | MemoryBank | MindMemOS |
|---|---|---|---|
| 架构定位 | 插件 / 封装 | 插件 | 操作系统(分层独立) |
| 建模方式 | 文本片段 + 向量 | 文本片段 + 图 | 实体-属性-时间三维 |
| 跨 Agent 迁移 | ❌ 绑定框架 | ⚠️ 半迁移 | ✅ 三层解耦全迁移 |
| 冲突解决 | 检索时临场判 | 检索时临场判 | ✅ Dreaming 离线归档 + supersedes |
| 用户反馈 | ⚠️ 仅显式 | ⚠️ 仅显式 | ✅ 显式 + 隐式,双层回流 |
| Skill 演进 | ❌ 静态文档 | ❌ 静态文档 | ✅ MindEvolve 自演进,Up +9.2% |
| LoCoMo 基准 | 85-89 | 80+ | ✅ 94.03 SOTA |
| 协议 | Apache / MIT | 闭源 | MIT(开源可商用) |
| 接入方式 | SDK | 私有 API | ✅ API+SDK+CLI+OpenClaw插件+Skills |
一句话定位差异:
- Mem0 / Letta 把记忆当「向量库的缓存」
- Cognee / MemoryBank 把记忆当「图谱的节点」
- MindMemOS 把记忆当「独立的、可迁移的、自演进的操作系统」
六、谁该立刻装?——三类人行动指南
👨💻 个人开发者:
- 之前每次 Agent 跑长任务都「重新交代背景」 → 装 MindMemOS,一次交代终身有效
- 想要 Skill「越用越聪明」而不是「写完不动」 → 装 MindMemOS,让你的 SKILL.md 自动演进
🏢 企业 / 团队:
- 多个 Agent(客服、销售、编程、运营)共享同一份「客户档案」 → 用 MindMemOS,三层独立架构天然适合
- 担心数据绑死在某一家 LLM 厂商 → MindMemOS MIT 开源 + 独立架构,记忆迁移零成本
🧪 AI 算法工程师 / 研究者:
- 想研究长期记忆的演进机制 → 直接读 MindMemOS 源码,Dreaming / Feedback / MindEvolve 都是论文级实现
- 想在 LLM4AD(自动算法设计)领域跟进前沿 → MindMemOS 已在 LLM4AD_Next 上集成,三层记忆(Task/Project/Global)针对算法搜索场景定制
七、一些需要冷静看的点
华为诺亚这次开源很猛,但我们也得冷静一下:
- 新开源项目(2026-08-03),生产环境建议先小流量试点。
- LoCoMo 94.03 是 GPT-4.1-mini 作为回答模型的结果,换模型可能分数波动。论文里 MindMemOS 也披露了在 Qwen / DeepSeek 等开源模型上的对比,整体领先但绝对分不同。
- Dreaming 离线整理需要算力——按论文数据每天处理 10 万条记忆大约 30 分钟单卡 A100,企业级落地时建议用云服务或排队机制。
- Skill 演进需要真实执行轨迹作为「监督信号」——如果你的 Skill 之前没有 add/search 调用反馈,进化的效果会打折扣。
八、写到最后——为什么这件事比你想的重要
昨天的 AI Agent 是这样的:
「你好,请给我项目背景、需求偏好、技术栈清单……」
明天的 AI Agent 应该是这样的:
「上次你说想用 FastAPI + uv 管理依赖,Redis 缓存用 dict 协议别用 redis-py,今天我直接按这个来了——对了,你上次提到的 alembic 升级到 1.13,你装了吗?」
这中间差的不是一次 prompt,而是一整套「记忆操作系统」。
MindMemOS 是 2026 年我们看到的第一份「分层解耦 + 自演进」的工业级长期记忆方案。它不是给某个 Agent 加一个 feature,而是给整个 Agent 生态铺设一层基础设施。
下一篇我会写 MindMemOS 接入 OpenClaw 的完整 demo,包括怎么把 Self-Improving Agent、Planning-with-Files、Claude-Mem 这些热门 Skill 和 MindMemOS 串起来。
关注我,别错过。
附录:项目地址速查
| 类型 | 链接 |
|---|---|
| GitHub | GitHub - mindscale-noah/MindMemOS · GitHub |
| 官网 | https://mindmemos.cn |
| 协议 | MIT |
| 云服务 | https://mindmemos.cn(开放注册) |
| 集成平台 | https://llm4ad-next.cn(自动算法设计) |
| Star 数 | 上线即破 Star,新增持续(截至 2026-08-06) |