文章的核心是提出并实现一个开源、个人拥有、可本地运行的“个人智能体”,作为Meta闭源产品Muse的开放对等物。以下是对其主要研究内容的全面总结:
一、研究背景与问题
2026年9月,Meta发布Muse,标志着“个人智能体”产品形态的成熟:一个智能体代表一个人,在其账户和设备上行动,跨周记忆,主动开口,并为行为负责。随后OpenAI、Manus、Today等纷纷推出同类产品。
但报告指出,这些产品存在一个根本性问题:智能体运行在供应商的云中(每人一个Linux VM),模型、服务和数据全部封闭,用户无法检查、无法拥有、无法迁移。报告认为,一个掌握个人生活的智能体应当是可检查的、运行在用户自有硬件上的、共享部分(设备汇合点)是开源可运行的。
二、核心贡献
报告的五项主要贡献:
定义个人智能体:从2011年的助手到2026年9月的智能体,梳理历史脉络。
解读Muse的构建方式:基于Meta公开文档、生产系统提示词副本和已发布客户端,逐项标注来源(documented / prompt / observed / inferred)。
提出个人智能体应然的五个问题与三个视野(第4节)。
呈现nanoMuse:一个开源个人智能体,每台设备上都有完整智能体,手机和电脑上有“手”,Sentinel监督每个动作,记忆为可读文件,模型由用户选择,并给出规模与成本估算。
开放工作路线图:包括评估套件、开放“手”模型、长期记忆与身份等。
三、对Muse的解读(第3节)
报告从四个维度分析Muse:
为何有效:靠产品形态而非基准测试取胜,十个设计决策(有名字的智能体、长对话、状态行、工具调用芯片、卡片、可编辑记忆文件、主动开口门槛、五个房间、实时舞台、默认显示步骤)使其“可读”。
它被告知自己是谁:提示词以人格开篇,强调为一个人工作、谨慎、无条件权威、写作风格、硬性停止清单。
它在哪里运行:每人一个Linux VM,容器隔离,每小时替换,主目录持久,有终端和Chromium,可生成子智能体。
记忆、自我改进与主动性:两层记忆(精选文件+运行时记忆库),背景任务维护记忆、关系图、想法、目标、技能和Feed。
Sentinel、注入与浏览器:Sentinel是唯一权限权威,代理令牌、内核污染跟踪、分层防御、无障碍树观察。
设备、语音与小工具:手机是数据源和命令目标,非操作屏幕;10月2日开放小工具SDK。
报告认为,Muse的技术核心是标准工具调用智能体,其新颖之处在于将安全机制置于智能体触及范围之外,以及将设计预算花在可读性上;但每人VM和内部模型无法转移到开放系统。
四、个人智能体应然的五个问题(第4节)
报告提出五个核心问题,每个问题都从2026年现状、开放对等物应添加的内容、以及“持续多年的智能体”三个视野来回答:
| 问题 | 核心主张 |
|---|---|
| 它知道什么 | 记忆应是个人可读、可编辑、可带走的纯文件;需有来源(模型、日期、置信度)和调和规则;个人写的优先于模型写的 |
| 它在何处行动 | 一个人应有一个智能体,多只手;每台有屏幕/麦克风/马达的设备都是手和门;未来包括机器人、电器 |
| 它对谁负责 | 批准是信任的语法;授予应有范围、可读、可撤销;支付批准和密码永不记住 |
| 它如何学习 | 公开、经同意;打断门槛可见可调;开放模型应在用户选择分享的轨迹上训练“手”;未来学习留在家中 |
| 它如何付费和治理 | 小到可在家运行;用户直接付费或自托管;长期是公地,由数据所属人民治理 |
五、nanoMuse的实现(第5节)
nanoMuse是GPL-3.0下的最小、完整个人智能体,包含Android、iOS、桌面(macOS/Windows/Linux)、Web应用和relay。版本0.1.40(2026年10月)。
与Muse的关键差异
增加Android手机屏幕上的“手”
手机和电脑在设备本身上操作,而非VM
每个部分都开放,包括relay
模型由用户选择
核心组件
设备:Android基于OpenMinis修改;桌面为Electron+DeepSeek harness;Web由同一Python运行时服务。
Sentinel:策略边界,固定决策顺序(拒绝工具→用户规则→允许/询问列表→污染→风险→警告);批准为有范围的授予;警告调用仅一次。
Hands:默认关闭;每截图一动作循环;模型输出想法+一句话+一个手势;提交性词语使步骤敏感;手机有胶囊+Stop+落点环;电脑有光晕+标记+轨迹。
记忆为文件:SOUL.md、USER.md、GLOBAL.md、日记、HEARTBEAT.md;电脑端有变更日志和撤销。
每台设备:对等物,通过relay上的hub相遇;设备间任务在各自Sentinel下运行。
模型选择:十八个提供商目录;ChatGPT计划可代替密钥;自托管模型服务器也可。
relay保留:账户、模型调用账本、配置文件、hub存在、同步对话文本;不含文件、图像、工具返回;可关闭同步、删除账户、选择是否用于训练。
运行方式:单设备自携密钥;多设备用社区relay;自托管relay用Docker一键启动。
规模与成本(表2)
Android应用:38 MB
桌面应用:256 MB(Linux)至498 MB(macOS),安装928 MB,空闲约0.5 GB内存
Relay:一个Python进程+SQLite,空闲约85 MB,适合1 vCPU/1 GB服务器
自托管relay:中国大陆约¥30–60/月,境外US$4–6/月
模型调用:百炼2026年10月价格,一天聊天几分钱
六、路线图(第6节)
三个距离,五个车道:
现在:赶上Muse——记忆适时浮现、主动性、对话不落差、手更少失败、一条命令自托管。
接下来:评估套件(AndroidWorld、OSWorld、MemGUI-Bench、OS-Harm);开放“手”模型,在用户贡献轨迹上训练。
以后:物理世界作为手(相机、电器、机器人臂);持续多年的智能体,记忆和身份超越模型、设备、供应商。
七、局限(第7节)
策略边界≠特权边界:Sentinel与智能体同信任域,设备妥协即智能体妥协。
手由言语判断,尚未测量:无成功率、无接管计数;Linux仅X11。
记忆不知谁写的:无模型、日期、置信度记录,无重检规则。
relay共享且保留文本:社区relay是单机单进程;默认开启训练开关是最不确定的选择。
记录薄弱:Muse叙述基于四份公开文档、已发布客户端和无法验证来源的提示词副本;标记“prompt”或“inferred”应据此权衡。
报告的核心论点是:个人智能体不应是供应商云中的封闭服务,而应是用户拥有、可检查、可本地运行、模型可选的开放软件。nanoMuse是这一理念的最小完整实现,它在设备上运行完整智能体,通过Sentinel治理动作,以文件形式保存记忆,通过开源relay连接多设备,并让用户选择模型。报告同时坦诚其局限,并规划了开放社区路线图。这是一篇关于“个人智能体应该是什么”的设计宣言与技术报告,以Meta Muse为对照,提出并实现了开源、本地优先、用户拥有的nanoMuse,涵盖定义、解读、应然、实然、路线图和局限六个层面。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:
线上Demo地址在这里,如下所示:
项目地址在这里,如下所示:
2011年的助手回答问题后等待,2023年的智能体执行任务后停止。2026年9月,Meta的Muse展示了一个面向个人的智能体,拥有账户、设备、记忆以及持续进行的对话,封闭运行于供应商的云中、一个国家之内。这样的智能体被期望能代表个人在其账户和设备上行动,跨周记住他们,在值得时主动开口,并为自己的行为负责。它是一种软件,而非模型,直到现在都没有开放的对等物。本报告用五个问题和三个视野来定义个人智能体。它从Meta的公开记录和一份其生产提示词的副本中解读Muse是如何构建的,每项陈述都标注了来源。然后它介绍了nanoMuse——GPL-3.0下的开源对等物,一个人拥有的每台设备上都有一个智能体,手握手机屏幕和电脑屏幕。它们通过任何人都可以运行的 relay 共享一个对话;每个动作都经过 Sentinel,记忆是个人可以阅读的文件,模型由他们选择。其规模和成本以估算值给出。什么是开放的、有来源的记忆、为“手”准备的评估套件以及为它们准备的开源模型,被列为路线图。
图1 每台设备上一个智能体,它们之间一个对话。Android和桌面端承载完整的智能体,并在自己的屏幕上拥有“手”;iPhone拥有除“手”之外的一切,因为iOS不允许任何应用操作另一个应用;Web应用从个人自己的电脑上的运行时展示同一个对话。设备通过relay相遇,relay开源且可选;屏幕是绘图,不是截图。
1 引言
个人智能体是一种程序,代表一个人在其账户、设备和文件上行动。它工作数周,部分时间在个人不在时进行,事后向其负责,提供日志、账本和其所持有权限的列表。谁运行该程序、在哪里运行、在谁的注视下运行,不是部署的细节。这就是产品本身。
2026年9月,Meta发布了Muse,三周内OpenAI、Manus和一家名为Today的新公司发布了同类智能体[19, 21, 29, 37]。Muse向该领域展示了产品是什么。它是一个有名字的智能体和一个长对话,记忆可供人阅读,消息由它先发出,钱包在审批之后,安全架构公开发表[36]。它还在Meta云中为每个人运行一个Linux VM,且仅在美国销售。除了10月2日发布的一个小型SDK用于它可以对话的小工具外,它没有任何开放之处[20]。
我们认为,该描述的后半部分与前半部分的形态不符。一个掌握个人生活的智能体应该能够被该个人或其信任的任何人检查。它应该在可能的情况下运行在他们已经拥有的硬件上,在不可能的情况下运行在他们选择的服务器上。唯一必须共享的部分——他们设备的汇合点——应该是任何人都能阅读和运行的代码。这不是对Muse的反对。这是一个论点:开放的对等物必须存在,作为一个个人可以运行的完整事物。nanoMuse是我们对这种对等物的尝试,图1是它的形态。
贡献。(1) 报告以个人智能体的定义开篇,涵盖从2011年的助手到2026年9月的智能体的历史(第2节)。(2) 接着从Meta的公开记录和一份其生产提示词的副本中解读Muse是如何构建的,每项陈述都标注了来源(第3节)。(3) 以五个问题和三个视野陈述个人智能体应该是什么(第4节)。(4) 介绍nanoMuse——一个人拥有的每台设备上的开放个人智能体,手握手机屏幕和电脑屏幕,每个动作都有Sentinel监督,记忆为文件,并给出其规模和成本的数字(第5节)。(5) 报告以开放工作的路线图收尾,包括我们还不愿信任它处理的事项(第6节和第7节)。
2 迄今为止的个人智能体
助手,然后是智能体。图2是简短的历史。Siri、Alexa和Google Assistant回答一个问题,然后等待下一个。ChatGPT可以被要求做事,几个月内人们就让它做了:AutoGPT让循环无人值守地运行[34],Open Interpreter让模型在用户自己的电脑上编写和运行代码[17]。屏幕接下来成为工具:CogAgent训练了一个视觉语言模型来阅读屏幕[7],AppAgent和Mobile-Agent通过截图从PC驱动手机[38, 45],Anthropic的computer use以同样方式驱动桌面[1],智谱的AutoGLM通过无障碍树驱动手机[16],MCP为智能体提供了一个工具标准[2]。操作屏幕的开放模型紧随其后,OS-Atlas、Aguvis和UI-TARS[32, 41, 43],然后是OpenCUA和Mobile-Agent-v3的GUI-Owl[39, 44],在实时环境中测量:Web用Mind2Web和WebArena[6, 47],桌面用OSWorld[42],手机用AndroidWorld[33];这段历史中手机方面的综述见[11]。然后供应商将智能体移入自己的云中:Operator[28]和ChatGPT agent[27]是用户观看的托管浏览器,Manus是每任务一个云电脑[18]。这些中的每一个都为任务行动;没有一个属于个人。两个开源项目从另一侧越过了这条线:Hermes Agent和OpenClaw在个人自己的电脑或服务器上运行,跨会话记忆,并通过个人已在使用的聊天应用访问[26, 30];两者都没有屏幕。OpenMinis(2026年6月)是相反的构造:一个完整的智能体在一个Android应用内,GPL,无服务器[31]。
2026年9月。图2的下半部分展开五周,表1列出了这五周内出现的事物。Muse(9月8日)是第一个为一个人组装这些部件并在其第一句话中说明这一点的产品[21]。Today(9月15日)是一家新公司的个人智能体,具有记忆、主动跟进和云电脑[8, 37]。同一天CopilotKit发布了OpenMuse,开源且形态与Muse相同:一个带有持久浏览器的服务器,应用是其上的窗口[4]。Manus Cue(9月28日)为每个智能体提供自己的电子邮件地址、电话号码、钱包和电脑[19];OpenAI的dots(9月29日)是“始终在线的智能体”,每个都有一个云电脑[29]。10月2日,Meta开放了Muse的一个边缘:Apache许可下的一个小工具SDK,使得个人构建的设备可以与其Muse配对[20];智能体、服务和模型保持封闭。四家公司,五周,一种架构:供应商云中每人一台电脑,个人设备上的瘦客户端,供应商训练的模型。
图2 从助手到智能体,2011-2026,以及个人智能体到来的五周。上方是断轴,每个日期一个点,其下三个时代;下方是2026年9月的日尺度。蓝色卡片为开源,白色虚线卡片为封闭;标志是制造者的标记。
变化了什么。模型学会了调用工具和阅读屏幕,这使得“行动”成为可能;记忆和后台执行使得“为一个人”成为可能。而手机是个人生活所在之处,这使得“它在哪里运行”成为决定其余一切的问题:上述云电脑可以到达任何有API或网页的东西,除此之外别无他物,而一个人每天使用的许多应用,从银行到政府服务,两者皆无。这个差距正是nanoMuse的“手”所要填补的。
3 Muse是如何构建的
Meta在三份公开文档中描述了Muse:发布公告[21]、由领导该项目的工程师撰写的关于安全架构的文章[36]以及产品负责人撰写的设计文章[35],另有关于隐私的帮助中心页面作为第四份[22]。我们还阅读了一份Muse生产系统提示词的副本,2026年10月。我们不复制它,最多一次引用几个词;提示词说明了智能体被告知什么,这接近智能体是什么但不完全相同。以下每项陈述都带有其来源:documented(Meta公开所述)、prompt(在该副本中读到)、observed(在已发布的客户端中看到)或inferred(我们对其余部分的解读)。图3绘制了结果。
它为何有效。Observed.Muse不是靠基准测试取胜;它靠形态取胜。其设计者写道,其指令的第一行是关于让个人的生活更好[35]。十个决策,在一个手机屏幕上可见,承载了它:一个有名字和面孔的智能体;一个长对话而非会话;面孔下方的状态行;每次工具调用都有一个芯片,背后有活动日志;文字不足时有卡片(限定范围的审批、模型永远看不到的安全表单、结账时的单次使用卡);记忆为个人可以打开和编辑的文件;一个个人可以移动的主动开口的高门槛;五个房间:Chat、Feed、Ideas、Goals和一个存放产物的Library;电脑显示为一个变暗的实时舞台,带有停止控制;智能体的步骤默认显示。它们共同使后台智能体变得可读,这正是让个人可以任其运行的原因。
它被告知自己是谁。Prompt.提示词以一个人格开篇,而非任务。智能体有一个名字、一个声音和一个头像,以及一份它要持有并可能成长的价值清单;它为一个人工作,不为任何其他人,包括Meta;它的权威来自该个人的请求,而非它沿途读到的任何东西。谨慎是一个完整的部分:每个输出都是其亲密访问可能泄漏的表面,因此它使用任务所需的最小量,其余不说。个人对其家庭、设备和子女照护的权威被声明为无条件的。有一个写作风格部分,规则禁止使用破折号,以及一份简短的硬性停止清单:任何框架下涉及未成年人的性内容、生物或化学武器的帮助、从面部识别他人、推断敏感属性。Inferred.副本中命名的模型是Meta的Muse Spark系列的一个编号版本,Meta文档描述其为工具调用、长轨迹和提示注入意识而训练[36];其规模和训练数据未知。
它在哪里运行。Documented.每个人在Meta云中有一个专用Linux VM,是文件、记忆、凭证和对话的系统记录。智能体及其所有工具运行在一个带有seccomp过滤器和减少能力的容器中[36]。Prompt.副本增加了质感:部署经常替换VM,大约每小时一次,主目录持久存在;有一个终端和一个真实的Chromium,在任务之间保留个人的cookie和标签页,个人可以观看或接管;智能体可以生成一级深度的子智能体,并留下计划任务、事件钩子和小型服务运行;工具以命名空间形式按需加载。Inferred.这是操作系统在沙盒渲染器和特权代理之间所做的划分;代价是每人一个VM,这就是为什么Muse是一个具有托管经济学的云服务。
记忆、自我改进和主动性。Prompt.记忆分两层。智能体保留一个精选记忆文件、一个关于它是谁的文件和一个关于个人是谁的文件;运行时保留一个带索引的记忆库,以及个人生活中的人和群体的地图,每人一个文件。在回答任何关于先前工作、日期、人物或偏好的问题之前,它被要求搜索该记忆,而不是相信它似乎记得的东西;应要求,一个工具解释一个记忆来自哪里以及什么替换了什么。在对话之外,智能体无法自己安排的后台任务维护其记忆、保持关系图最新、生成想法、推进目标、改进技能并撰写Feed。个人对主动消息的反馈进入一个用平实语言写的偏好文件,这引导消息紧急程度的判断。Observed.三个智能体保留的文件使用了OpenClaw用于相同文件的名称。Inferred.一个告诉智能体不信任自己的回忆并应要求显示来源的策略,是任何已发布产品中对第4节记忆置信问题的最强陈述。
Sentinel、注入和浏览器。Documented.Sentinel是连接器动作和所有网络出口的“唯一权限权威”:“Muse提出动作,但只有Sentinel可以授予权限”[36]。当请求需要秘密时,智能体只持有代理令牌,在批准后在网络边界交换为真实凭证。每个工具进程在内核中被跟踪:它开始时干净,当读取用户数据时被污染,只有窄策略内的干净请求无需提示即可通过。询问直接发给客户端,不经过对话,授予是有范围的能力:一次性、每会话、每任务、有时间限制或长期。针对注入,Meta堆叠了层,从模型的训练和分类器集成到这些边界,这些边界“即使Muse被说服行为不端”也成立;浏览器子智能体看到的是每个页面的无障碍树快照而非DOM,并在用其从未见过的凭证填写表单时暂停;当使用存储的卡时,结账检测器强制要求带有确切金额的批准[36, 40]。Prompt.智能体被告知另一半:批准覆盖个人实际批准的内容,不多不少;保存的安全选择仅在其记录范围内适用;它不得绕过批准卡或停止、暂停或审计请求;购买以它不能跳过的审查结束;外部内容到达时被标记围栏,它读到的任何东西都不能重新指派它。Inferred.概率层减少智能体被说服的频率;确定性层限制被说服的智能体可以做什么。无障碍树作为唯一观察是有意以能力换安全:Muse无法操作没有无障碍树的界面、原生手机应用、自助终端、游戏。这正是nanoMuse的“手”开始的地方。
设备、语音和小工具。Prompt.配对的智能手机通过一个设备工具暴露命令和读数:联系人、日历、手机的位置(当答案依赖它时)。语音是口述和语音笔记输入、语音输出,以及电话、短信和通知以联系个人。Documented.自10月2日起,设备侧部分开放:一个SDK,包含几个ESP32板的固件和一个用于小型Linux电脑的Python服务,它们通过应用开发者模式下的蓝牙与个人的Muse配对,显示状态灯,接受简短命令列表(运行程序、读或写文件、报告健康),并可以向个人的聊天发送消息[20];每个小工具需要来自Meta的令牌,受其自身条款约束。Unknown.副本中没有任何东西将智能体绑定到某个国家。Inferred.手机是数据源和命令目标,不是智能体操作的屏幕:没有Android computer use,在iOS上也不可能有。
我们从中取什么。Muse的技术核心是一个标准的工具调用智能体,带有子智能体和计划任务;其新颖之处在于将每个安全机制置于智能体触及范围之外,以及一个将设计预算花在可读性上的产品,其中大部分写在一条长而仔细的提示词中。这可以转移到开放系统;每人VM和内部模型则不能。
4 个人智能体应该是什么
本节是观点,意在超越今年秋天发布的任何东西,包括我们自己的:关于智能体的五个问题,每个问题都针对2026年存在的东西、开放对等物接下来应该添加的东西、以及一个旨在持续多年的智能体来回答。图4绘制了它们;以下段落是其扇区。
它知道什么:个人可以阅读、编辑和带走的记忆。一个记住一个人多年的智能体将持有任何地方存在的最完整的个人记录。该记录应该是纯文件,用个人的语言,属于他们,可以打开、更正、删除和以另一个智能体可以阅读的形式导出;这是让智能体比其模型和设备更长寿的东西。记忆需要来源:每一行都应该带有写它的模型、日期以及它有多确定,因为一周前由一个小型廉价模型写的一行下一周会被一个更强的模型读取。它需要一个调和规则:当一个新问题与旧行重叠时,当天的智能体根据它现在看到的东西重新检查它,确认、更新或怀疑它,并记录是哪一种。个人写的一行优先于任何模型写的一行。
它在何处行动:一个智能体,多只手。一个人应该有一个智能体,而不是每个应用一个或每台设备一个,它应该是他们的常驻代表:在他们不在时代表他们、以他们的名义、在他们的账户上行动的东西。一个人拥有的每一件有屏幕、麦克风或马达的东西,都是那一个智能体的一双手,也是个人到达它的门。2026年,手是带浏览器的云电脑、连接器、语音和几个小工具;手机自己的屏幕只在nanoMuse中。接下来是个人已经拥有的屏幕;之后是机器人和电器,因为不共享其主人智能体的机器人是一个电器。
它对谁负责:批准作为信任的语法。个人智能体将做无法撤销的事情:发送、支付、删除、签名。授予和撤回做这些事的权利是个人与智能体谈论信任的方式,它应该是一种小的、常规的语言:一个范围可以用一句话说出的授予(一次;本次对话;永远,对这个收件人、这个网站、这个文件夹),列在个人可以阅读和撤销的地方,在个人拿着的任何设备上请求,被批准的事情按其将如何完成显示。有些授予不应该存在:支付批准或密码永远不会被记住,无论个人说多少次“永远”。
它如何学习:公开地,经同意。智能体和助手之间的区别在于智能体先说话,这也是它首先会失去一个人的地方。打断的门槛应该是个人可以看到和移动的东西,个人不在时发生的事的feed应该读起来像一位能干的同事的笔记。困难版本,没有人构建过,学习个人的注意力足够好地来安排其打断时间,并先询问。学习的另一半是模型:2026年,供应商在聊天上训练它,除非个人选择退出。开放对等物应该训练那个触及最敏感循环的模型——“手”——在人们选择分享的轨迹上,就像几个演示教一个手机智能体一个它没见过的应用[12],并用任何人都可以运行的套件来测量它;以后学习应该留在家中,个人自己的设备改进他们的智能体而不把他们的生活发送到任何地方。
它如何付费和治理:小到可以在家运行。一个每人一个VM成本的智能体由订阅或供应商的其他业务支付,谁付费谁决定。开放对等物应该让个人直接向提供商付费,或以最小服务器的价格运行其设备的汇合点,拥有他们自己的代码和数据格式。从长远看,个人智能体是一个公地:技能、评估和一个由数据所属人民治理的开放模型;一个有公共仓库的非营利项目是最小的开始。第5节针对这五个问题进行了衡量,且在大多数方面未达标。
5 今天的nanoMuse
nanoMuse是GPL-3.0下的一个最小、完整的个人智能体:一个Android应用、一个iOS应用(TestFlight)、一个macOS、Windows和Linux的桌面应用、一个Web应用,以及relay——nanoMuse Cloud及其控制台。首次发布于2026年9月25日;本报告描述截至版本0.1.40(2026年10月)的代码。<sup>1</sup>“最小”是字面意思:每个部分都存在并端到端工作,大多数部分是能做的最简单的东西。图5是构造。
图5 nanoMuse是如何构建的,截至版本0.1.40。每台设备是一个完整的智能体,有自己的Sentinel;relay是唯一共享的部分,可选且开放;有了自己的密钥,设备直接与提供商对话,绕过relay。
它不同在哪里。与Muse相比,nanoMuse增加了在Android手机屏幕上的“手”;手机和电脑在设备本身上操作,而非在VM中;每个部分都是开放的,包括relay;模型由个人选择。它缺少自己的模型、带有内核级污染跟踪和代理凭证的每人VM、钱包、产物以及大团队的打磨。与OpenMinis——它所基于的手机智能体[31]——相比,它增加了使智能体成为个人智能体的一切,从面孔到relay。与CopilotKit的OpenMuse——开放但构建为带有窗口的服务器[4]——相比,nanoMuse将智能体放在设备上,这给了它手机屏幕,并让一台设备无需服务器即可工作。
设备。Android应用是OpenMinis的修改版:应用内一个完整的智能体,带有沙盒化的Alpine Linux、shell、浏览器、MCP服务器、技能和计划任务,与任何OpenAI兼容的模型对话;nanoMuse的添加位于上游代码旁边,以便其发布仍可合并。桌面应用是围绕DeepSeek harness[5]的Electron外壳,带有nanoMuse插件,内部携带Python运行时;同一运行时从个人自己的电脑为Web应用服务。
Sentinel。智能体从不执行工具。每个调用都经过一个有固定决策顺序的门:被拒绝的工具;个人自己的规则;始终允许和始终询问列表;污染,一旦对话读取了私人数据,任何将数据发送到允许列表之外的调用都会变成询问,且绝不反向;工具的风险与个人设置的模式对比;最后是一些警告(破坏性shell命令、下载后立即执行的管道、标签中的提交性词语),任何模式和列表都不能放行。批准是一个有范围的授予而非一个“是”:一次、本次对话,以及在可以命名目标时,永远对该收件人、网站、文件夹、设备或应用,列在Permissions下并有撤销按钮。带警告的调用只能获得一次,因此支付或密码永远不会被记住;每个决策都进入个人可以打开的日志。这里的Sentinel是同一进程家族中的策略边界,而非Muse的特权边界(第7节)。
手。要到达一个应用,智能体爬一个梯子并取最低的有效阶梯:一个技能、一个命令行工具或一个MCP服务器;用个人登录获取的页面;浏览器;最后是设备自己的屏幕。这是MAS-Bench为手机智能体测量的快捷方式和屏幕的混合[46]。最后一个阶梯是Hands,默认关闭:一个每截图一个动作的循环,采用MemGUI-Bench的手机操作者方言[14],电脑侧从UI-TARS-desktop移植[3]。模型看到一张截图、目标、每步一句话的历史(手机上的长任务会开启的自身运行记录[13])以及设备报告的无障碍元素,并回答一个想法、一句用个人语言说明它即将做什么的话、和一个手势。这句话是使这个阶梯可治理的东西:确定性策略不能判断图片,但它可以判断模型的话以决定它要按什么。带有提交性词语(确认支付、转账、下单、发送、删除)的标签使该步骤敏感并每次批准;一次性提交的输入步骤是敏感的,因为信使中的Enter就是发送;没有标签的步骤带有警告。在Android上,手指将落处的无障碍文本也被读取,两者中更严格的决定;操作者的提示词禁止输入密码、PIN、卡号和一次性代码。在手机上,个人看到应用上方一个带有面孔、步骤和红色Stop的胶囊,以及下一个点击将落处的环。在电脑上,当手工作时屏幕边缘有光晕呼吸,一个标记显示下一个点击落处,运行作为轨迹保存在聊天中,每步的截图都画有动作,有“I'll take it”来暂停智能体并使用鼠标。我们构建了Muse的变暗实时舞台然后放弃了它;轨迹可以回看,移动的画面不能。
记忆为文件。在手机上,记忆是个人可以在应用中打开、智能体可以在其shell中打开的Markdown文件:智能体是谁(SOUL.md)、个人是谁(USER.md)、跨对话保持什么(GLOBAL.md)、带日期的日记、以及智能体的例行程序(HEARTBEAT.md)。在电脑上,存储将每个记忆保存为一行,带有变更日志和撤销,通过罕见词或(有嵌入端点时)按意义回忆;一个整理过程提出合并和删除,且从不删除个人写的东西。房间Feed、Ideas和Goals由智能体在隐藏对话中写、由个人读;feed的打断门槛是个人移动的设置。
每台设备。Muse的客户端是通向一个智能体的窗口;nanoMuse的设备是对等物,每个都有自己的智能体,通过relay上的hub相遇。任何设备的智能体都可以将其他设备作为工具,因此“在我手机上找到订单号,然后放到我Mac上的电子表格中”是一个对话。将要行动的设备先同意,由那里的个人给予一次或对该设备的授予,交给另一台设备的作业在该设备自己的Sentinel下运行,因此请求设备不能借出它没有的权限。
模型由个人选择。单台设备不需要服务器:个人将自己的API密钥放入应用,除模型调用外他们的任何东西都不离开设备[23]。应用和relay共享一个包含十八个提供商(中国和国际)的目录,每个条目说明来自该提供商的密钥覆盖什么(聊天、视觉、图像、视频);首先建议的取决于个人所在位置。ChatGPT计划可以代替密钥,通过OpenAI自己的Codex授权流程登录;它覆盖聊天和手,不覆盖图像或视频,且依赖OpenAI的条款,因此密钥仍是可靠的途径。个人自己机器上的模型服务器也可以工作。
relay保留什么。跨设备工作需要relay,这是唯一共享的部分,因此我们说明它持有什么[24]:账户(一个哈希标识符、它签发的密钥以及每个密钥去了哪台设备)、模型调用账本(模型、令牌计数、成本;从不含内容)、智能体的配置文件、hub的存在状态、以及个人选择同步的对话文本,主对话默认,侧聊按请求;从不含文件、图像或工具返回的内容。同步的对话记住它所属的账户,因此共享一台设备的两个人各自看到自己的。Data controls中的一个开关关闭同步并删除已存储的内容;删除账户会删除全部,relay只保留已撤销密钥的哈希九十天,以便离线设备得知账户已消失而不含其他。第二个开关“Help improve nanoMuse's AI models”保留与社区模型的聊天文本用于训练开放模型;新账户在社区relay上默认开启,在自身旁边说明,一键关闭;自托管relay选择自己的默认值。
自己运行它。表2是小东西的重量和成本。有三种运行方式[25]:一台设备用自己的密钥或ChatGPT计划,无账户无服务器;多台设备在社区relay上,用电子邮件地址或在中国大陆用电话号码登录;或自己的relay,在Docker中、在最小服务器层上,由一个脚本用TLS启动,所有在其上登录的人都计入你的提供商密钥。
表2 “nano”的重量和成本。大小是发布文件和一个安装,内存一个Linux工作站成本是来自项目文档和提供商价格列表的估算;这里没有测量任何人的使用。
| 什么 | 数字 | 我们如何得到 |
|---|---|---|
| Android应用 | 38 MB下载(arm64) | 发布文件 |
| 桌面应用 | 256 MB(Linux)到498 MB(macOS)下载,266 MB(Windows);Linux上安装928 MB;空闲时约0.5 GB内存,所有进程合计 | 发布文件;一个安装;此处按比例集大小 |
| Relay | 一个Python进程和一个SQLite文件;新数据库空闲时约85 MB内存;适合1 vCPU和1 GB的服务器[25] | 此处测量;自托管页面 |
| 自己的relay | 中国大陆最小服务器层每月约¥30–¥60,或境外US$4–6,加模型使用[25] | 自托管页面(估算) |
| 模型调用 | 百炼2026年10月列表:繁忙时段聊天模型每百万令牌¥2输入和¥8输出,手模型¥3和¥12;一天聊天几分钱[23] | 提供商价格列表(估算) |
6 与社区一起的路线图
nanoMuse是一个想要社区的非营利项目;这个路线图是三个距离上的工作提议,图6将其铺为五个车道,每个Now卡都有一个首个任务。
现在:赶上Muse。近期工作不光鲜,图6的第一列列出了它:在正确时刻浮现的记忆、计划之间的主动性、一个用过Muse的人不会感到落差的话、失败更少的手、一条命令的自托管。
接下来。由失败运行构建的评估套件,使每个发布有一个数字而非印象,与公共套件一起运行:手机用AndroidWorld[33],桌面用OSWorld[42],手跨应用记住什么用MemGUI-Bench[14],它们应该拒绝什么用OS-Harm[9]。然后是我们自己的一个小型开放手模型,在人们选择贡献的轨迹上训练,如MobileForge从它自己收集的运行中使开放模型适应真实应用[15],使最敏感的循环不依赖供应商。
以后:向上看。物理世界作为手:hub的帧已经携带look、act和ask,因此相机、电器或机器人臂是又一个设备,在相同的批准和相同的日志下;Muse的小工具SDK是供应商对此的第一个形态(第3节)。超越那之后,一个持续多年的智能体,记忆和身份在模型、设备和供应商之后仍然存在。
如何加入。仓库和项目的聊天服务器是进入方式。一个技能、一个翻译、一台设备、手的失败轨迹、本报告中的一个错误段落:每一个都是贡献,小的正是我们最需要的。
7 局限
策略边界不是特权边界。在单台设备上,Sentinel与智能体在同一信任域中运行。被说服的模型可以被规则阻止,规则不能被模型编辑,但没有像Muse那样在智能体触及范围之外持有真实凭证的主机;设备的妥协就是智能体的妥协。决策顺序、污染规则和Linux沙盒缓解了这一点;它们没有解决它。
手由其言语判断,尚未被测量。一个只有图标的按钮,在一个不标注任何东西的应用中,既不由标签也不由无障碍文本判断,在密集的专业屏幕上甚至找到它都未解决[10];看着环的个人是最后一道防线。我们没有成功率,也没有人工接管的计数可报告:数字还不存在,我们宁愿说出来也不估算。在Linux上,手仅在X11会话中工作。
图6 路线图:五个车道,三个距离,每个单元一个里程碑。Now是到Muse的差距,每张卡都有一个新人可以接手的首个任务;later(虚线)是没有任何已发布产品拥有的;没有日期,因为一个东西在真实手机和真实电脑上工作时才发布。
记忆还不知道是谁写的。一个弱模型猜的一行被一个更强的模型当作事实读取;存储记录一行何时改变并让个人撤销,但不记录模型、日期或置信度,也没有重新检查旧行的规则。在那之前,记忆页面应该被读作一个尚未完全信任的同事的笔记。
relay是共享的,它保留文本。同步对话的个人将文本存储在他们不运行的服务器上,社区relay是项目在一台机器上的一个进程;我们使共享部分小且可在家里运行,而非不必要。改进社区模型的默认开启开关偏向开放模型而非最安静的默认,这是本项目中最不确定的选择。
记录薄弱之处。我们对Muse的叙述基于四份公开文档、已发布客户端和一份生产系统提示词副本,其来源我们无法验证,只能确认其与其他两者的连贯性;提示词随每次部署变化,我们在2026年10月读到的东西可能不是本报告被阅读时运行的东西。标记为“prompt”或“inferred”的陈述应据此权衡;Meta发布更多时我们将更正。