news 2026/10/12 3:29:59

AI快速进步但不会通用超级智能:技术约束与工程实践判断

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI快速进步但不会通用超级智能:技术约束与工程实践判断

1. 为什么这个判断值得认真对待

1.1 一个反直觉但越来越主流的观点

AI 会快速进步,但不会走向通用超级智能——这个判断乍一听有点矛盾。既然进步快,为什么不会走到那一步?但如果你真的在一线做模型训练、做产品落地、做推理优化,你会发现这个判断其实非常务实。它不是在唱衰 AI,而是在区分两件被大众媒体混为一谈的事:能力的快速提升和形态的根本跃迁。

Nathan Lambert 是 AI 领域少数既做过前沿研究、又长期做公开技术写作的人。他在强化学习、指令微调、RLHF 这些方向上有实打实的工程经验,同时他的表达一直偏克制,不太做夸张预测。所以当他说"快速进步但不会通用超级智能"时,这不是情绪化的立场,而是基于对训练管线、数据瓶颈、评估方式的长期观察得出的判断。

我自己的体会是:过去几年每次出现一个能力跃升,外界就会立刻跳到"AGI 要来了",但真正做工程的人看到的是一条收益递减但仍在增长的曲线,而不是一条垂直起飞的指数曲线。这两者的区别,决定了你该怎么规划自己的技术路线和产品节奏。

1.2 这篇文章想解决什么问题

我想把 Lambert 这个判断拆开,讲清楚三件事:

  • "快速进步"具体快在哪里,哪些方向还在持续变好,哪些已经明显放缓;
  • "不会通用超级智能"背后的技术理由是什么,不是哲学争论,而是工程约束;
  • 对做产品、做研究、做技术选型的人,这个判断意味着什么,你该怎么下注。

适合读这篇的人:正在做 AI 应用落地的工程师、做技术规划的管理者、以及被各种"AGI 倒计时"说法搞得很焦虑的从业者。如果你只是想看热闹,这篇可能不太适合,因为我会花大量篇幅讲训练细节和评估方法。

提示:本文讨论的是技术趋势判断,不涉及任何具体公司、机构或人物的评价,所有案例均为说明性虚构场景。

2. 拆解"快速进步":到底哪些能力在涨

2.1 能力提升的三个真实来源

要理解"快速进步",先得搞清楚进步从哪来。根据公开的研究脉络和工程实践,当前模型能力的提升主要来自三个方向,而且这三个方向的边际收益完全不同。

第一个来源是数据质量和配比。早期大家拼的是数据量,后来发现数据质量、去重、配比、课程学习(curriculum learning)对最终效果的影响远大于单纯堆量。一个典型的例子是:同样规模的模型,经过精细清洗和配比的数据训练后,在推理类任务上的表现可以拉开明显差距。这个方向的收益还在,但已经进入"精耕细作"阶段,靠的是大量实验和人工判断,不是简单加资源就能解决。

第二个来源是后训练(post-training)技术。指令微调、RLHF、DPO、以及各种偏好优化方法,是过去两三年能力提升最明显的环节。一个基础模型经过好的后训练,在对话、指令遵循、格式控制上的表现会有质的变化。这个方向目前仍然活跃,但已经出现明显的方法收敛——大家用的核心思路越来越像,差异更多在数据构造和工程细节上。

第三个来源是推理时计算(inference-time compute)。也就是让模型在回答前"多想一会儿",通过思维链、搜索、采样投票等方式提升难题上的表现。这个方向是最近讨论最多的,因为它不需要重新训练,直接改推理策略就能涨点。但它有明确的天花板:推理时计算只能把模型已有的潜在能力激发出来,不能凭空创造新能力。

2.2 哪些方向已经明显放缓

说完成长点,也得说放缓的地方,否则"快速进步"就变成了盲目乐观。

预训练规模扩展的收益在递减。这是业内比较一致的观察。早期模型参数量翻倍,效果提升非常明显;现在继续扩大规模,需要的数据量、算力、工程复杂度都在指数上升,但效果提升的斜率明显变缓。这不是说扩展没用,而是说单纯靠"更大"来换"更强"的性价比在下降。

长尾知识和精确事实性仍然是硬骨头。模型在常见问题上表现很好,但一碰到冷门领域、精确数值、时效性强的信息,就容易出错。这个问题不是靠加参数能解决的,它涉及数据覆盖、检索增强、以及模型对"自己不知道"的校准能力。

多步复杂推理的稳定性不足。单步推理现在做得不错,但一旦任务需要十几步甚至几十步的连贯推理,错误就会累积。你让它做一道中等难度的数学题,它可能对;你让它做一个需要二十步推导的工程估算,它中途跑偏的概率就明显上升。

下面这张表可以帮你快速对照当前的能力格局:

能力方向当前状态进步速度主要瓶颈
指令遵循与对话较成熟放缓数据质量、边界情况
单步推理良好中等训练数据覆盖
多步复杂推理不稳定较快但波动大错误累积、验证机制
长尾事实性较弱慢数据覆盖、检索整合
代码生成较强较快长上下文、项目级理解
多模态理解快速提升快跨模态对齐、数据
自主长程任务早期不确定规划、记忆、可靠性

2.3 为什么"快"不等于"会起飞"

这里有个关键的认知陷阱:把能力曲线的斜率当成趋势的外推。看到过去两年进步快,就假设未来两年会同样快,再假设这个速度会一直持续到超级智能。但真实的技术曲线往往不是这样。

我打个比方。一个学生从 60 分提到 80 分,可能只需要好的学习方法和几个月努力;从 80 分提到 90 分,难度明显上升;从 90 分提到 95 分,可能要付出前面所有努力的总和。AI 能力提升也有类似结构:容易摘的果子先被摘掉,剩下的越来越难。

而且更关键的是,不同能力之间不是简单叠加。一个模型在语言上很强、在推理上不错、在代码上也可以,不代表它就能自主完成一个需要长期规划、自我纠错、跨领域整合的复杂任务。能力的"拼接"本身就是一个未解决的难题。

3. "不会通用超级智能"的技术理由

3.1 通用超级智能到底指什么

在讨论"会不会"之前,得先定义清楚"通用超级智能"指什么。通常它包含几个特征:

  • 跨领域通用:在几乎所有认知任务上达到或超过人类顶尖水平;
  • 自主性:能自己设定目标、拆解任务、长期执行;
  • 自我改进:能显著提升自身能力,形成正反馈循环;
  • 可靠性:在关键任务上稳定可信,不会随机失败。

这四个特征里,前两个是"能力"问题,后两个是"系统"问题。而恰恰是后两个,构成了当前技术路线最难跨越的门槛。

3.2 数据墙:模型没见过的东西学不会

第一个硬约束是数据。当前主流方法本质上还是从数据中学习模式。模型能处理它训练时见过或类似的东西,但对完全陌生的领域,它的表现会明显下降。

有人会说,那合成数据呢?让模型自己生成数据训练自己。这个思路确实有用,但有天花板:合成数据的质量受限于生成它的模型的能力。如果模型本身在某个方向不行,它生成的合成数据在这个方向上也不会好,自我提升就变成了自我循环。

这就像一个学生只靠自己复习,没有新教材、没有老师反馈,他的进步会很快遇到瓶颈。真正的能力跃迁往往需要新的信息源,而不是在已有信息里反复打转。

3.3 可靠性墙:能对一次不等于能一直对

第二个硬约束是可靠性。模型在演示里表现惊艳,但一到生产环境就暴露问题:同样的输入,换个说法结果就变了;多跑几次,答案不一致;遇到边界情况,直接崩掉。

这个问题在单次任务里可能不明显,但在长程自主任务里是致命的。假设一个任务需要 50 个步骤,每步成功率 95%,那么整体成功率只有 0.95 的 50 次方,大约是 7.7%。也就是说,单步看起来很高的可靠性,在长链条里会迅速衰减。

要让长程任务可靠,单步成功率得做到 99.9% 甚至更高,而且还要有自我验证和纠错机制。这跟"模型很聪明"是两回事,它是一个系统工程问题。

3.4 目标与价值对齐:不是技术问题那么简单

第三个约束是目标和价值。一个真正通用的系统,需要理解"什么该做、什么不该做",需要在模糊情境下做出符合人类预期的判断。这不是靠更多数据能解决的,因为它涉及价值判断的复杂性和情境依赖性。

我举个生活化的例子。你让一个助手"帮我把这件事处理好",什么是"处理好"?在不同情境下答案完全不同。人类靠大量常识和社会经验来填补这些空白,而模型目前在这方面还很脆弱。它可能在某类任务上表现很好,但换一个情境,它的判断就可能完全跑偏。

3.5 为什么这些约束不会"自然消失"

有一种乐观假设是:只要模型足够大、数据足够多、训练足够久,这些约束会自然消失。但从工程角度看,这个假设站不住脚。

数据墙不会因为模型变大而消失,因为问题在于信息源,不在于处理能力。可靠性墙不会因为模型变聪明而消失,因为问题在于错误累积的数学结构。价值对齐不会因为模型见多识广而消失,因为问题在于情境判断的开放性。

这些约束更像是"结构性"的,而不是"规模性"的。规模能缓解一部分,但不能从根本上消除。

4. 这个判断对从业者意味着什么

4.1 产品侧:别赌"全能",赌"专精"

如果你在做 AI 产品,这个判断最直接的启示是:不要赌一个模型什么都能干,而要赌它在特定场景下干得足够好。

具体来说,与其做一个"通用助手",不如做一个在明确场景下、有明确输入输出、有明确质量标准的工具。比如:

  • 不是"帮你写所有文档",而是"帮你把会议记录整理成结构化纪要";
  • 不是"帮你做所有分析",而是"帮你从这批数据里找出异常点并给出可能原因";
  • 不是"帮你写所有代码",而是"帮你把这段逻辑重构成可测试的函数"。

场景越具体,你越能定义清楚"什么算成功",越能设计评估方法,越能把可靠性做到可用水平。通用性带来的灵活性,往往被可靠性问题抵消掉了。

4.2 技术侧:把精力放在"最后一公里"

从技术投入角度,这个判断意味着:基础模型的进步你控制不了,但应用层的"最后一公里"你有很大空间。

所谓最后一公里,包括:

  • 检索增强:把模型不知道的、时效性强的信息通过检索补进去;
  • 工具调用:让模型去调用计算器、数据库、API,而不是自己硬算;
  • 验证与纠错:加一层检查机制,对模型输出做校验和修正;
  • 人机协作:在关键决策点让人介入,而不是追求全自动。

这些工作不性感,但它们是让 AI 真正可用的关键。我见过太多团队把精力全花在"换更强的模型"上,却忽略了这些工程细节,结果产品体验一直上不去。

4.3 个人侧:别被"AGI 倒计时"绑架

对个人来说,这个判断最大的价值是降低焦虑。每隔一段时间就有人喊"AGI 还有 X 年",搞得很多人觉得自己的技能马上要过时。但如果你理解技术约束,你会知道:

  • 能力提升是渐进的,你有时间适应;
  • 通用系统不会突然出现,专精能力仍然值钱;
  • 真正稀缺的是把 AI 用好的能力,而不是 AI 本身。

与其焦虑"会不会被取代",不如花时间学怎么把 AI 工具用出效果,怎么设计好的工作流,怎么判断模型输出的质量。这些能力在可预见的未来都会很值钱。

5. 常见误读与排查

5.1 把"进步快"读成"马上到"

最常见的误读是把当前进步速度线性外推。看到模型一年内从不会写代码到能写不错的代码,就假设明年能独立做项目,后年能自己开公司。但真实曲线往往在某个点后变缓,而且不同能力的曲线形状不一样。

排查方法:当你听到一个预测时,问三个问题——它假设了哪个能力在持续提升?这个能力的瓶颈是什么?瓶颈有没有被解决?如果答不上来,这个预测大概率是拍脑袋。

5.2 把"不会超级智能"读成"AI 没用"

另一个极端是听到"不会通用超级智能"就觉得 AI 是泡沫。这完全是误读。不会通用超级智能,不等于不会深刻改变很多行业。计算器不会通用智能,但它改变了数学工作方式;搜索引擎不会通用智能,但它改变了信息获取方式。AI 在专精任务上的价值已经足够大。

5.3 把技术判断读成立场表态

还有一种误读是把技术判断当成"站队"。讨论 AI 会不会通用超级智能,本质是技术问题,不是立场问题。你可以同时相信"AI 会带来巨大变化"和"它不会变成科幻里的超级智能"。这两者不矛盾。

下面这张表整理了常见误读和对应的正确理解:

常见误读问题所在更准确的理解
进步快 = 马上 AGI线性外推曲线会变缓,瓶颈真实存在
不会 AGI = AI 没用非黑即白专精价值已经很大
规模够大就能突破忽视结构约束数据、可靠性、对齐是结构问题
讨论这个 = 站队混淆技术与立场这是工程判断,不是立场
通用 = 更好忽视可靠性专精往往比通用更可用

5.4 实操中的排查清单

如果你在做技术规划,可以用这个清单自查:

  1. 我的方案是否依赖"模型什么都能干"这个假设?如果是,风险很大。
  2. 我有没有定义清楚"什么算成功"?没有的话,评估无从谈起。
  3. 我的任务链条有多长?链条越长,可靠性要求越高。
  4. 我有没有为"模型不知道"的情况设计兜底?没有的话,生产环境会出问题。
  5. 我是在追"更强模型",还是在做"最后一公里"?后者往往回报更高。

6. 我自己的几点体会

做了几年 AI 相关的工程和产品,我对这个判断的体会是:它帮你把注意力从"未来会不会"拉回到"现在能做什么"。

我踩过的一个坑是:早期总想等"更强的模型出来再动手",结果等来等去,发现真正决定产品体验的,是数据质量、流程设计、错误处理这些"不酷"的东西。模型换了一代又一代,但这些工程能力是累积的,越早开始越有优势。

另一个体会是:别把模型的"演示能力"当成"生产能力"。演示里它妙语连珠,生产里它可能因为一个边界情况就崩掉。评估一个 AI 方案,一定要看它在真实数据、真实场景、真实压力下的表现,而不是看精心准备的 demo。

最后分享一个小技巧:当你评估一个 AI 能力时,别只问"它能不能做",要问"它做错的概率有多大、错了之后怎么发现、发现了怎么补救"。这三个问题的答案,往往比"能不能做"更能决定一个方案能不能落地。

这个判断后续还可以这样扩展:如果你在做垂直领域的 AI 应用,可以进一步研究该领域的数据获取难度、错误容忍度、以及人工介入成本,这三个变量基本决定了 AI 在这个领域能走多远。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/12 3:29:44

Hive性能优化与执行原理深度解析

1. 这不是背题手册,而是一份Hive生产环境“踩坑实录”你打开这份文档时,大概率正面临两类场景:要么是明天就要进面试间,手心冒汗地翻着零散笔记,对着“Hive和传统数据库区别”这种题反复默念;要么是刚在数仓…

作者头像 李华
网站建设 2026/10/12 3:28:57

知识蒸馏小模型72小时工程落地全链路实测

1. 项目概述:为什么一个“小模型发布72小时”的测试值得专门写一篇长文?“知识蒸馏小模型发布72小时,我替你试完了”——这个标题不是营销噱头,而是我过去三天的真实工作日志。它背后藏着当前AI落地最现实的矛盾:大模型…

作者头像 李华
网站建设 2026/10/12 3:28:21

Cortex 多租户认证与授权实战:基于 X-Scope-OrgID 的租户隔离方案

可观测性时序数据库后端指标监控 【免费下载链接】cortex A horizontally scalable, highly available, multi-tenant, long term Prometheus. 项目地址: https://gitcode.com/gh_mirrors/cortex6/cortex 点击查看 免费下载 本篇技术指南围绕 Cortex 的多租户认证与…

作者头像 李华
网站建设 2026/10/12 3:27:31

Chainer 实现 DCGAN 完整指南:从 GAN 原理到 CIFAR-10 图像生成

深度学习机器学习 【免费下载链接】chainer A flexible framework of neural networks for deep learning 项目地址: https://gitcode.com/gh_mirrors/ch/chainer 点击查看 免费下载 本教程基于 Chainer 官方仓库中的 DCGAN 示例(examples/dcgan 目录&a…

作者头像 李华
网站建设 2026/10/12 3:22:13

声呐阵列信号处理——声呐阵列波束形成(第一章第三节)

一、声呐阵列模型3.接收数据模型(1)数据组成阵元的实际接收数据是信号、噪声等干扰的叠加,所以接收数据模型建立的前提需是信号模型、噪声模型的构建。对于第m个阵元,其接收数据可以表示为数据中包含期望信号,D个干扰信…

作者头像 李华