1. 为什么这个判断值得认真对待
1.1 一个反直觉但越来越主流的观点
AI 会快速进步,但不会走向通用超级智能——这个判断乍一听有点矛盾。既然进步快,为什么不会走到那一步?但如果你真的在一线做模型训练、做产品落地、做推理优化,你会发现这个判断其实非常务实。它不是在唱衰 AI,而是在区分两件被大众媒体混为一谈的事:能力的快速提升和形态的根本跃迁。
Nathan Lambert 是 AI 领域少数既做过前沿研究、又长期做公开技术写作的人。他在强化学习、指令微调、RLHF 这些方向上有实打实的工程经验,同时他的表达一直偏克制,不太做夸张预测。所以当他说"快速进步但不会通用超级智能"时,这不是情绪化的立场,而是基于对训练管线、数据瓶颈、评估方式的长期观察得出的判断。
我自己的体会是:过去几年每次出现一个能力跃升,外界就会立刻跳到"AGI 要来了",但真正做工程的人看到的是一条收益递减但仍在增长的曲线,而不是一条垂直起飞的指数曲线。这两者的区别,决定了你该怎么规划自己的技术路线和产品节奏。
1.2 这篇文章想解决什么问题
我想把 Lambert 这个判断拆开,讲清楚三件事:
- "快速进步"具体快在哪里,哪些方向还在持续变好,哪些已经明显放缓;
- "不会通用超级智能"背后的技术理由是什么,不是哲学争论,而是工程约束;
- 对做产品、做研究、做技术选型的人,这个判断意味着什么,你该怎么下注。
适合读这篇的人:正在做 AI 应用落地的工程师、做技术规划的管理者、以及被各种"AGI 倒计时"说法搞得很焦虑的从业者。如果你只是想看热闹,这篇可能不太适合,因为我会花大量篇幅讲训练细节和评估方法。
提示:本文讨论的是技术趋势判断,不涉及任何具体公司、机构或人物的评价,所有案例均为说明性虚构场景。
2. 拆解"快速进步":到底哪些能力在涨
2.1 能力提升的三个真实来源
要理解"快速进步",先得搞清楚进步从哪来。根据公开的研究脉络和工程实践,当前模型能力的提升主要来自三个方向,而且这三个方向的边际收益完全不同。
第一个来源是数据质量和配比。早期大家拼的是数据量,后来发现数据质量、去重、配比、课程学习(curriculum learning)对最终效果的影响远大于单纯堆量。一个典型的例子是:同样规模的模型,经过精细清洗和配比的数据训练后,在推理类任务上的表现可以拉开明显差距。这个方向的收益还在,但已经进入"精耕细作"阶段,靠的是大量实验和人工判断,不是简单加资源就能解决。
第二个来源是后训练(post-training)技术。指令微调、RLHF、DPO、以及各种偏好优化方法,是过去两三年能力提升最明显的环节。一个基础模型经过好的后训练,在对话、指令遵循、格式控制上的表现会有质的变化。这个方向目前仍然活跃,但已经出现明显的方法收敛——大家用的核心思路越来越像,差异更多在数据构造和工程细节上。
第三个来源是推理时计算(inference-time compute)。也就是让模型在回答前"多想一会儿",通过思维链、搜索、采样投票等方式提升难题上的表现。这个方向是最近讨论最多的,因为它不需要重新训练,直接改推理策略就能涨点。但它有明确的天花板:推理时计算只能把模型已有的潜在能力激发出来,不能凭空创造新能力。
2.2 哪些方向已经明显放缓
说完成长点,也得说放缓的地方,否则"快速进步"就变成了盲目乐观。
预训练规模扩展的收益在递减。这是业内比较一致的观察。早期模型参数量翻倍,效果提升非常明显;现在继续扩大规模,需要的数据量、算力、工程复杂度都在指数上升,但效果提升的斜率明显变缓。这不是说扩展没用,而是说单纯靠"更大"来换"更强"的性价比在下降。
长尾知识和精确事实性仍然是硬骨头。模型在常见问题上表现很好,但一碰到冷门领域、精确数值、时效性强的信息,就容易出错。这个问题不是靠加参数能解决的,它涉及数据覆盖、检索增强、以及模型对"自己不知道"的校准能力。
多步复杂推理的稳定性不足。单步推理现在做得不错,但一旦任务需要十几步甚至几十步的连贯推理,错误就会累积。你让它做一道中等难度的数学题,它可能对;你让它做一个需要二十步推导的工程估算,它中途跑偏的概率就明显上升。
下面这张表可以帮你快速对照当前的能力格局:
| 能力方向 | 当前状态 | 进步速度 | 主要瓶颈 |
|---|---|---|---|
| 指令遵循与对话 | 较成熟 | 放缓 | 数据质量、边界情况 |
| 单步推理 | 良好 | 中等 | 训练数据覆盖 |
| 多步复杂推理 | 不稳定 | 较快但波动大 | 错误累积、验证机制 |
| 长尾事实性 | 较弱 | 慢 | 数据覆盖、检索整合 |
| 代码生成 | 较强 | 较快 | 长上下文、项目级理解 |
| 多模态理解 | 快速提升 | 快 | 跨模态对齐、数据 |
| 自主长程任务 | 早期 | 不确定 | 规划、记忆、可靠性 |
2.3 为什么"快"不等于"会起飞"
这里有个关键的认知陷阱:把能力曲线的斜率当成趋势的外推。看到过去两年进步快,就假设未来两年会同样快,再假设这个速度会一直持续到超级智能。但真实的技术曲线往往不是这样。
我打个比方。一个学生从 60 分提到 80 分,可能只需要好的学习方法和几个月努力;从 80 分提到 90 分,难度明显上升;从 90 分提到 95 分,可能要付出前面所有努力的总和。AI 能力提升也有类似结构:容易摘的果子先被摘掉,剩下的越来越难。
而且更关键的是,不同能力之间不是简单叠加。一个模型在语言上很强、在推理上不错、在代码上也可以,不代表它就能自主完成一个需要长期规划、自我纠错、跨领域整合的复杂任务。能力的"拼接"本身就是一个未解决的难题。
3. "不会通用超级智能"的技术理由
3.1 通用超级智能到底指什么
在讨论"会不会"之前,得先定义清楚"通用超级智能"指什么。通常它包含几个特征:
- 跨领域通用:在几乎所有认知任务上达到或超过人类顶尖水平;
- 自主性:能自己设定目标、拆解任务、长期执行;
- 自我改进:能显著提升自身能力,形成正反馈循环;
- 可靠性:在关键任务上稳定可信,不会随机失败。
这四个特征里,前两个是"能力"问题,后两个是"系统"问题。而恰恰是后两个,构成了当前技术路线最难跨越的门槛。
3.2 数据墙:模型没见过的东西学不会
第一个硬约束是数据。当前主流方法本质上还是从数据中学习模式。模型能处理它训练时见过或类似的东西,但对完全陌生的领域,它的表现会明显下降。
有人会说,那合成数据呢?让模型自己生成数据训练自己。这个思路确实有用,但有天花板:合成数据的质量受限于生成它的模型的能力。如果模型本身在某个方向不行,它生成的合成数据在这个方向上也不会好,自我提升就变成了自我循环。
这就像一个学生只靠自己复习,没有新教材、没有老师反馈,他的进步会很快遇到瓶颈。真正的能力跃迁往往需要新的信息源,而不是在已有信息里反复打转。
3.3 可靠性墙:能对一次不等于能一直对
第二个硬约束是可靠性。模型在演示里表现惊艳,但一到生产环境就暴露问题:同样的输入,换个说法结果就变了;多跑几次,答案不一致;遇到边界情况,直接崩掉。
这个问题在单次任务里可能不明显,但在长程自主任务里是致命的。假设一个任务需要 50 个步骤,每步成功率 95%,那么整体成功率只有 0.95 的 50 次方,大约是 7.7%。也就是说,单步看起来很高的可靠性,在长链条里会迅速衰减。
要让长程任务可靠,单步成功率得做到 99.9% 甚至更高,而且还要有自我验证和纠错机制。这跟"模型很聪明"是两回事,它是一个系统工程问题。
3.4 目标与价值对齐:不是技术问题那么简单
第三个约束是目标和价值。一个真正通用的系统,需要理解"什么该做、什么不该做",需要在模糊情境下做出符合人类预期的判断。这不是靠更多数据能解决的,因为它涉及价值判断的复杂性和情境依赖性。
我举个生活化的例子。你让一个助手"帮我把这件事处理好",什么是"处理好"?在不同情境下答案完全不同。人类靠大量常识和社会经验来填补这些空白,而模型目前在这方面还很脆弱。它可能在某类任务上表现很好,但换一个情境,它的判断就可能完全跑偏。
3.5 为什么这些约束不会"自然消失"
有一种乐观假设是:只要模型足够大、数据足够多、训练足够久,这些约束会自然消失。但从工程角度看,这个假设站不住脚。
数据墙不会因为模型变大而消失,因为问题在于信息源,不在于处理能力。可靠性墙不会因为模型变聪明而消失,因为问题在于错误累积的数学结构。价值对齐不会因为模型见多识广而消失,因为问题在于情境判断的开放性。
这些约束更像是"结构性"的,而不是"规模性"的。规模能缓解一部分,但不能从根本上消除。
4. 这个判断对从业者意味着什么
4.1 产品侧:别赌"全能",赌"专精"
如果你在做 AI 产品,这个判断最直接的启示是:不要赌一个模型什么都能干,而要赌它在特定场景下干得足够好。
具体来说,与其做一个"通用助手",不如做一个在明确场景下、有明确输入输出、有明确质量标准的工具。比如:
- 不是"帮你写所有文档",而是"帮你把会议记录整理成结构化纪要";
- 不是"帮你做所有分析",而是"帮你从这批数据里找出异常点并给出可能原因";
- 不是"帮你写所有代码",而是"帮你把这段逻辑重构成可测试的函数"。
场景越具体,你越能定义清楚"什么算成功",越能设计评估方法,越能把可靠性做到可用水平。通用性带来的灵活性,往往被可靠性问题抵消掉了。
4.2 技术侧:把精力放在"最后一公里"
从技术投入角度,这个判断意味着:基础模型的进步你控制不了,但应用层的"最后一公里"你有很大空间。
所谓最后一公里,包括:
- 检索增强:把模型不知道的、时效性强的信息通过检索补进去;
- 工具调用:让模型去调用计算器、数据库、API,而不是自己硬算;
- 验证与纠错:加一层检查机制,对模型输出做校验和修正;
- 人机协作:在关键决策点让人介入,而不是追求全自动。
这些工作不性感,但它们是让 AI 真正可用的关键。我见过太多团队把精力全花在"换更强的模型"上,却忽略了这些工程细节,结果产品体验一直上不去。
4.3 个人侧:别被"AGI 倒计时"绑架
对个人来说,这个判断最大的价值是降低焦虑。每隔一段时间就有人喊"AGI 还有 X 年",搞得很多人觉得自己的技能马上要过时。但如果你理解技术约束,你会知道:
- 能力提升是渐进的,你有时间适应;
- 通用系统不会突然出现,专精能力仍然值钱;
- 真正稀缺的是把 AI 用好的能力,而不是 AI 本身。
与其焦虑"会不会被取代",不如花时间学怎么把 AI 工具用出效果,怎么设计好的工作流,怎么判断模型输出的质量。这些能力在可预见的未来都会很值钱。
5. 常见误读与排查
5.1 把"进步快"读成"马上到"
最常见的误读是把当前进步速度线性外推。看到模型一年内从不会写代码到能写不错的代码,就假设明年能独立做项目,后年能自己开公司。但真实曲线往往在某个点后变缓,而且不同能力的曲线形状不一样。
排查方法:当你听到一个预测时,问三个问题——它假设了哪个能力在持续提升?这个能力的瓶颈是什么?瓶颈有没有被解决?如果答不上来,这个预测大概率是拍脑袋。
5.2 把"不会超级智能"读成"AI 没用"
另一个极端是听到"不会通用超级智能"就觉得 AI 是泡沫。这完全是误读。不会通用超级智能,不等于不会深刻改变很多行业。计算器不会通用智能,但它改变了数学工作方式;搜索引擎不会通用智能,但它改变了信息获取方式。AI 在专精任务上的价值已经足够大。
5.3 把技术判断读成立场表态
还有一种误读是把技术判断当成"站队"。讨论 AI 会不会通用超级智能,本质是技术问题,不是立场问题。你可以同时相信"AI 会带来巨大变化"和"它不会变成科幻里的超级智能"。这两者不矛盾。
下面这张表整理了常见误读和对应的正确理解:
| 常见误读 | 问题所在 | 更准确的理解 |
|---|---|---|
| 进步快 = 马上 AGI | 线性外推 | 曲线会变缓,瓶颈真实存在 |
| 不会 AGI = AI 没用 | 非黑即白 | 专精价值已经很大 |
| 规模够大就能突破 | 忽视结构约束 | 数据、可靠性、对齐是结构问题 |
| 讨论这个 = 站队 | 混淆技术与立场 | 这是工程判断,不是立场 |
| 通用 = 更好 | 忽视可靠性 | 专精往往比通用更可用 |
5.4 实操中的排查清单
如果你在做技术规划,可以用这个清单自查:
- 我的方案是否依赖"模型什么都能干"这个假设?如果是,风险很大。
- 我有没有定义清楚"什么算成功"?没有的话,评估无从谈起。
- 我的任务链条有多长?链条越长,可靠性要求越高。
- 我有没有为"模型不知道"的情况设计兜底?没有的话,生产环境会出问题。
- 我是在追"更强模型",还是在做"最后一公里"?后者往往回报更高。
6. 我自己的几点体会
做了几年 AI 相关的工程和产品,我对这个判断的体会是:它帮你把注意力从"未来会不会"拉回到"现在能做什么"。
我踩过的一个坑是:早期总想等"更强的模型出来再动手",结果等来等去,发现真正决定产品体验的,是数据质量、流程设计、错误处理这些"不酷"的东西。模型换了一代又一代,但这些工程能力是累积的,越早开始越有优势。
另一个体会是:别把模型的"演示能力"当成"生产能力"。演示里它妙语连珠,生产里它可能因为一个边界情况就崩掉。评估一个 AI 方案,一定要看它在真实数据、真实场景、真实压力下的表现,而不是看精心准备的 demo。
最后分享一个小技巧:当你评估一个 AI 能力时,别只问"它能不能做",要问"它做错的概率有多大、错了之后怎么发现、发现了怎么补救"。这三个问题的答案,往往比"能不能做"更能决定一个方案能不能落地。
这个判断后续还可以这样扩展:如果你在做垂直领域的 AI 应用,可以进一步研究该领域的数据获取难度、错误容忍度、以及人工介入成本,这三个变量基本决定了 AI 在这个领域能走多远。