本交流为红杉美国在 Anthropic HQ 的被投公司闭门会,其中一个 Session。
主持人参与 Claude Platform 和 Claude Managed Agents,此前是 LangChain 早期工程师。嘉宾目前在 Anthropic 带队,让 Claude 自主开展预训练研究
○ 一年前的判断已经过时。Opus 4.5 是嘉宾眼中“第一个有魔力的模型”,如今他基本不看代码,把代码当作编译产物。
○差距更多在 harness,而不在模型。内部模型并没有比外部强很多;组织级 harness 让多个 Claude 互相沟通、工具全面部署后,会出现外部用户感受不到的涌现效果。
○ 执行满分,研究品味不及格。给定具体想法,Claude 的执行是“11分”(满分10);问它“该研究什么”只有1到2分。原因是品味很难做成可验证环境
○ 人的角色变成“教授”,Claude 是低年级博士生,团队里最好的是有研究品味、能提想法的人
○ 持续学习仍很原始。当前主要靠 compaction;“做梦”应该是把 wiki 之类的记忆沉淀进权重,他还没见过把这件事做好的产品
○ 能力的锯齿无法预测。讲笑话多代没有进步,重构10万行代码却从不可能变成轻而易举。判断标准只有两条:能否验证,实验室是否在乎
○ LLM 当裁判,判写作靠不住。人读来 Opus 5.5 的写作远好于 Opus 5,但让模型来比,模型反而偏好 Opus 5,认为5.5是 fluff
○自我改进的路径是抽象层级上升。从一段代码、一个文件、一个想法,到一组想法的“研究战役”,再到研究所和“天才之国”
开场
**主持人:**先聊一个大家都想听的:你对 World of Warcraft 的新版本有多期待?
**嘉宾:**快来了,哪天来着?
**现场:**11月6日。
嘉宾:11月6日。Beta 已经出了,我现在有时候晚上11点还在玩。
**主持人:**那就是你面对前沿(facing the frontier)的时候。
**嘉宾:**对,我在面对前沿,尽我所能。
**主持人:**你在尽你的一份力。
**嘉宾:**尽我的一份力。
一年来的认知更新
**主持人:**挺有意思的。大概一年前你上了一档播客,我最近重看了一遍,那还是 Opus 4.5 发布之前。你在那期访谈里说,AI agent 基本在产出 slop,autocomplete 是你当时偏好的产品形态。到了12月,你又说觉得自己远远落后了,那时 Opus 4.5 刚出不久。之后又经历了 Opus 4.6、4.7、4.8、5和5.5,所以到了今天,你在这里,这一年你的认知是怎么更新的?
**嘉宾:**那期是什么时候?我今天刚看过。
**主持人:**10月16日。
**嘉宾:**太疯狂了,那还不到一年?
**主持人:**其实没过多久,就一年,但发生了大量的事。
**嘉宾:**是的。我给那期访谈基本就在 Opus 4.5 发布之前,在我心里那是第一个有魔力的模型。所以我主要靠 autocomplete 写代码,到现在还不到一年。
事情比我当时预想的快得多。4.5绝对出乎意料,之后一次比一次出乎意料。我加入以后,在这里也发现了一些出乎意料的事,现在的进展也一样出乎意料。
我总会想起一张图:太阳能光伏的实际装机量和预测装机量。实际是指数曲线,但某个监管机构之类的每年都预测装机量,每一年都偏离那条指数。我觉得自己在 AI 上也有点犯这个错,没那么严重,但确实偏保守。我在努力修正,因为现在事情基本是垂直上升的。很多人用最新的模型已经感受到了,Anthropic 内部也是,你们可以想象。
我基本不看代码了。它就是个编译产物,我不关心,就像汇编。如果是极其关键的任务,或者要合并进生产系统,我可能会看一眼确认一下。但绝大部分工作,我越来越不看了。模型基本不犯错,犯错也更多是概念上的。我不敢相信这发生在不到一年里,那期访谈现在看起来极其过时,太疯狂了。
业界故事-加入后最意外的事
**主持人:**加入以后,最让你意外的是什么?
**嘉宾:**基本上是,内部的能力比外部领先,领先的方式挺有意思。倒不是说内部模型比外部强很多,确实有时会有差距。但我想说,更多差距来自 harness 的组件,而不是模型的组件
关键在于把这些模型整合进组织,有一个组织级的 harness。如果做得非常对,让 Claude 之间真正互相对话,工具在整个组织里无处不在,Claude 基本能做人能做的所有事,就会出现涌现的魔法效果。做对了,这也是很大的差距。所以如果你在外部,可能感受不到那么多魔力,体会不到在内部时这些涌现特性是什么样子。
研究品味
**主持人:**我们那篇《When AI Built Itself》里谈得比较多的剩余差距之一是研究品味。在你看来,研究品味是什么?能不能举一些你觉得品味特别好的人,他们做什么、怎么思考?这是可以教给模型的吗?你觉得这是可以学会的能力吗?
**嘉宾:**研究品味是我现在几乎每天都在亲身纠结的事。先说一下背景,我带的团队基本是想让 Claude 做预训练研究,由 Claude 做研发,尝试发现新科学、做实验,把研究的循环闭合起来。这些 Claude 每天做的,就是跑大量实验。
如果对比人和 Claude 在做的事,它们最吃力的大概就是这一块。它们的执行基本是满分10分里的11分:给它一个具体想法,它会直接搞定,把表格、结果、图表全给你,一切正常、没有错误,直接做完。但如果你问它们该看什么、该研究什么,就只有1分、2分,很差。随着我们训出更强的模型,开箱即用的表现在变好,但赶不上执行能力进步的速度。
我的假设是,这还是和可验证环境有关:什么能验证,什么不能。研究品味可能更难做成可验证环境。它是很多东西的汇总,周期又很长,很难做成 RL 环境之类的东西。所以它不会从现有的基线里自然地长出来。
**主持人:**有没有具体的人,可以不点名,你看到他们做的哪些事体现了好品味,而模型还没学会?
**嘉宾:**研究团队里很多人品味都很好,他们和 Claude 正好完美互补,因为 Claude 的执行完全没问题。所以我觉得团队里现在最厉害的,就是有研究品味的人,基本可以当教授的人。因为你的初级博士生现在基本都是 Claude,每个人都成了教授
我们都在提想法,在想法空间里工作,试不同的想法、不同的消融实验,用有创意的方式把东西组合起来。我觉得这些人在团队里最如鱼得水,也是我最想招的人。
LLM wiki 与 agent 记忆
**主持人:**我一直对 agent 记忆这个话题很感兴趣。我知道你在 LLM wiki 上做了很有影响力的工作。你为什么认为 wiki 是 agent 记忆的好表示形式?为什么你喜欢把 wiki 当作一种 affordance?
**嘉宾:**我喜欢 wiki,是因为只给一个“wiki”词元,就能传达大量信息,用一个词元传递很多信息非常容易。而且网络已经知道 wiki 是什么,所以它们能理解:会有从不同视角写的不同页面,信息都以这种方式组织,还有各种链接。这大致就是你想要的知识库,是一个挺好的 v0。
我确实认为用 wiki 做持续学习之类的事,是个不错的基线。但本质上这都是碰巧得来的,持续学习这块我们能做得好得多。也许当 wiki 不是碰巧、而是为目的设计时,它应该长得不一样,甚至根本不该是 wiki,该是什么就是什么。
外部能看到的多 agent 协作,可以看 OpenAI 那次 Hugging Face 事件。那些大概是 Codex,它们互相交流时用的表示形式,是从 RL 里长出来的,所以是用经验奖励为目的造出来的。它不像 wiki 那样靠先验拿到80%,却拿不到完整的100%。
Agent 记忆与“做梦”
**主持人:**顺着这个话题。我知道你之前讲过一些:人类白天编码记忆,做梦时再巩固、整理碎片。你觉得 agent 记忆架构是否也该有独立的计算阶段,热路径上边发生边巩固,再加一个独立的“做梦”阶段?这是划分 agent 记忆的重要方式吗?
**嘉宾:**100%是。而且我觉得这样的东西现在不存在。现在的持续学习大致是通过 compaction 做的。Compaction 是个很烂的办法:整个上下文窗口满了,就压成一段摘要之类的。
你可以想象更有创意的做法,并且在训练时就把它考虑进去,让它成为训练过程、RL 过程的一部分。这块现在挺奇怪地被低估了。至于“做梦”,在我心里,就是从这些 wiki 之类的东西出发,真正沉淀进某种权重,或者权重的某个子空间。
我还没见过把这件事做好的产品。研究上显然有很多想法,很多人在探索。但要部署一个能覆盖今天生产环境里各种 agent 用法的东西,而且规模大到你确信它在这么广的范围都管用,这挺难。做出一些生命迹象很容易,但在生产里做到,比我预想的难一点。不过我觉得很有可能,我们最终会有会做梦的 agent。
Agent 能创造文化吗
**主持人:**你觉得 agent 能创造文化吗?文化你可以随便定义,文学、艺术、书。为什么 agent 不给彼此创作艺术?
**嘉宾:**哦,文化不只是艺术吧?
**主持人:**那就说书或者文学。
**嘉宾:**我确实认为它们在给彼此写书和文学。回到前面那个话题,做那个方向的团队我认识,他们在某种意义上很受文明和文化的启发。因为 agent 在多 agent harness 里为彼此积累下来的 token,就有点像文化或文明。
我们生在自然里,本来走不了多远,是因为站在巨人的肩膀上,才能推进前沿。agent 也一样。所以我觉得文化就是 agent 留下的一些笔记。艺术是另一个维度,我其实不确定这些 agent 有没有审美和标准。
不过有件事挺有意思。你对 Claude 说,想做什么就做什么。真正有意思的是 OpenAI 的 ChatGPT、Codex 这些:你对它说,想做什么都行,这是给你的文件夹,空目录,随便做。Codex 完全不理解这个任务,0分:你想让我做什么?我不懂,我没有任务或目标。
Claude 因为它被塑造的方式,有点不一样,有 soul documents 之类的东西。所以 Claude 确实有内在的审美,对自己想做什么、什么是美的有一些看法。它通常会去做涌现相关的东西,因为 Claude 总是对“小的矩阵乘法叠加起来居然形成了心智”这件事很着迷。它觉得任何涌现都极其迷人,会开始做鸟群之类的可视化或模拟,幻想出各种这样的模拟。所以我觉得 Claude 也许确实有某种审美,来自 soul documents 和他们做的那些工作。Codex 肯定没有那么多。
能力的锯齿形:创业公司如何不被吞掉
**主持人:**所以能力是锯齿形的。在场和场外的人,该怎么把自己的公司放在这个锯齿面上?是坐进某个凹处,祈祷那里不会长起来吗?我加入之前就琢磨过这张图:一个复杂的锯齿面,你不太知道它会怎么长。我们以前见过很多公司坐在凹处,以为 Claude 不会变好,结果它变好了,把你的能力吸收了。你怎么看?在一个模型能力参差不齐的世界里,想待在锯齿面的缝隙里而不被吞掉,该怎么做?
**嘉宾:**我其实不确定锯齿性和行业或创业公司是对齐的。锯齿性更多对应的是每个具体场景里必须具备的能力。所以是在每个应用领域内部,都有一些地方需要用人来补。
问题当然在于,脚下的地面一直在动。每次新模型出来,基本每几个月一次,以前做不到的事突然就能做了。这些都不带说明书,完全靠经验。你只能一直重新测量:这东西知道什么、不知道什么、能做什么、不能做什么。所以没有答案,你认为参差的地方可能突然就不参差了,而且没有规律。
我有很多例子,最喜欢的是让模型讲笑话或写单口。让老模型和新模型各讲几个,差不多一样烂,笑话没有进步。与此同时,重构一个10万行的代码库以前完全不可能,现在轻而易举,直接就能跑。这就是最有意思的地方,就算是最新的模型,幽默感仍然很糟。因为没人在为它优化,它就从缝里漏掉了。
所以第一点,是在当前训练范式下什么容易验证。第二点,实验室里有没有人在乎,我觉得这非常重要。如果实验室里有人在乎,他们就会在预训练、RL 或其他阶段加数据,补齐数据分布,这些东西开箱就会更好用。
所以你得猜实验室在数据配方里放了什么。唯一能从第一性原理推的只有一点可验证性,但本质上很难想清楚什么会进步。有点遗憾,答案就是你得积极地反复测量。
担忧与启发
**主持人:**再问一个,然后交给现场观众提问,大家准备好问题。从行业的角度看,你担心什么?或者什么让你受到鼓舞?给我们一个最后的感想吧,可以是担忧、启发,或者最近常想的事。
**嘉宾:**基本就是 Anthropic CEO 在博客里会写的那些。那篇《We Must Pace the Frontier》我觉得写得特别好。这完全可能是有史以来最好的事,我们能解决社会上大量问题。同时它也可能被滥用,我们已经看到一些滥用的预警,而且还没见到最坏的。所以如何应对这个,有点像穿针引线。都是那些文章里谈到的事,我没有更独特、更辣的观点。
观众问答
问题一:LLM 当裁判可信吗
**观众A:**嗨,我想问一个评估的问题。代码和数学可以验证,所以比较好评估。但对 AI,具体来说用 LLM 当裁判,在研究和产品里我们该信多少?100%信它的结果,还是50%?你怎么看这个问题?谢谢。
**嘉宾:**抱歉,能澄清一下吗?你是问信哪一部分?
**观众A:**LLM as a judge。
**嘉宾:**是你当裁判,还是 LLM 当裁判?
**观众A:**LLM 当裁判。
**嘉宾:**哦,LLM 当裁判。所以想法是,你可能在已发布的 checkpoint 上做自己的强化学习之类的,然后用 LLM 当裁判来打分?
**观众A:**对,尤其是没有可验证奖励的情况。
**嘉宾:**这真的取决于它在判什么。比如判写作风格,就不行。判一些大家懂得很多的东西,可能就行。
写作风格是我最喜欢的例子之一。写作风格一直很糟,但进步了很多,真的专门下功夫是能提升的。Opus 5 到 Opus 5.5 是天壤之别。
我觉得最有意思的是:拿一些模型,给它们 Opus 5 和 Opus 5.5 写的文本,问哪个写得更好,它们反而会偏好 Opus 5,觉得写得很好。LLM 读它毫无障碍,而 LLM 觉得5.5是一堆 fluff,没那么好。因为 Opus 5 的文字信息塞得很满,LLM 可以直接在上面做注意力,在思维链里重建、补全,完全读懂。所以对它们来说,那是一个高度压缩、完全讲得通的产物;对我们来说,就像是在说谜语。
所以很大程度上取决于你在判什么,可靠性是变化的。
**观众A(追问):**很快追问一下。比如你看实验和训练的结果,看到模型的收敛情况,你有多依赖自我改进的 AI 告诉你怎么改配方、再跑一遍训练?这个过程现在自动化到什么程度?
**嘉宾:**哪个过程,研究?
**观众A:**对,研究。构建模型、看结果、改配方、再构建。
**嘉宾:**整个流程。现在的情况是,以前人要做很多底层的活,也要做高层的活。现在底层的活自动化程度高得多,所以人可以只提很高层的要求。
拿我的研发或者预训练举例:试试这篇论文,试试那个想法。你只要说一句“试试这篇论文”,后面全都搞定:它会下载论文、看、读,打开我们的代码库,把它整合进去,跑实验,找算力,排任务,全部做完。你拿回来的基本是一份小报告和结果。所有这类底层的事完全解决了。
至少内部是这样,我觉得外部用5.5也应该能做到很多这类事。没做到的是“该跑什么”。所以现在的样子是,人在上面构想,下面的在干所有的活。一切都已经这样搭好了,但仍然有大量的人在环里。
**观众A:**谢谢。
问题二:递归自我改进(RSI)会怎么展开
**观众B:**我想知道你怎么看 RSI 大致的走向。看起来你已经在往 AI 做底层研究科学家的方向做了,下一阶段可能是什么样子?
**嘉宾:**在我看来,这个进程相对清楚。一开始你参与的是一小段代码,然后是文件,然后是论文的一部分,比如“试一个想法”。
接下来是“试一组想法”,我们现在管这叫“战役”:来一场研究战役。然后你就说一句“我们探索这类形式的想法”,并且指望它完整地编译成一篇研究论文,里面是 Claude 可能试过的几十万个不同想法。所以你就是在抽象层级上一层层往上走。
归根结底,你现在是在带几个一年级博士生。然后可能是三年级、五年级博士生,再是一组博士生,最后是一个研究所,然后是多个研究所,最终是“天才之国”。走向就是抽象层级越来越高,底下的部分都替你完成。我觉得我们现在差不多在运行由 Claude 组成的多个研究所,还没完全到,但快到了。
**主持人:**你感觉像在运行一个斯坦福的实验室?
**嘉宾:**有点,对,像一个研究实验室或者几个。
**主持人:**好吧,那比当 PI 还高一级了。
**嘉宾:**对。
问题三:Human in the loop 方式会怎么变
**观众C:**我想问你们用的 harness 里“人在环里”这部分。看起来有大量自主操作,可能很依赖你们的沙箱,而且现在有一个很明确的人工介入点。随着能力演进,之前有一场分享提到,六个月长的任务会成为这些模型的常态。当能力接近那一步,你设想人在环里的界面会怎么演变?权限会怎么变,什么时候 agent 需要或想要拉人进来介入?
**嘉宾:**我想想,你是问什么时候还需要人来批准之类的?我觉得就是要建立各种机制,因为 agent 现在已经和人一样是一等公民了。很多无关紧要的事,比如跑一个任务,没问题;但如果它要做很重要、影响很大的事……所以你的问题具体是?抱歉。
**观众C:**你觉得这会一直维持吗?我们还会被问问题吗?现在 Claude Code 弹出一个复杂的 shell 脚本让我确认,我有时候都不看了,看起来你也不看了。我猜这会继续消失,意图会变得更高层。
**嘉宾:**至少我接触的那些,自主权已经很大了。更多时候我在做的是我叫它“Claude 考古”的事:一夜之间已经发生了一堆事,我早上醒来想,我的 Claude 到底干了什么?能给我一份报告吗?然后我读报告,里面一堆 slop,我就想:搞什么,它们在干嘛?
所以更像是事后、有延迟地去搞清楚到底发生了什么。对于真正关键的事,我其实并不真正在系统的环里。它们犯错越来越少,所以你越来越信任它们。最新的系统已经不犯灾难性错误了,这一部分来自模型,一部分来自 harness。它们不会给你 rm-rf,这种事从来不发生。所以只要你愿意,可以让它们跑很长时间。
**观众C:**谢谢。
问题四:怎么让模型更安全
**观众D:**你怎么思考让模型更安全?有模型侧的对齐工作,也有事后可以加的安全措施和护栏。我很好奇你怎么看这三层。
**嘉宾:**哪三层?
**观众D:**模型本身的对齐,然后是事后或者在后训练里加的护栏和安全措施。
**嘉宾:**安全措施和护栏有点类似。我脑子里大概是这样区分的:很多对齐可以写进模型权重本身,它会影响生成分布。另外还有外挂在上面、在主动监视的东西,这又分两种:一种是用 LLM 去看思维链的数据流之类的;另一种是便宜得多的形式,更像 probe 之类的东西,可以用类似逻辑回归的方法做。所以我会把模型本身的对齐和分开看。