一、《苦涩的教训》理论体系与行业规律
《苦涩的教训》(The Bitter Lesson)是强化学习领域奠基人、2024 年 ACM 图灵奖得主 Richard Sutton 于 2019 年发布的经典行业短文,全文篇幅简短,却系统复盘了人工智能七十余年的迭代演进规律,成为后续 AGI 路径探索的重要理论参照,被全球 AI 学界广泛引用与研讨。
该文献总结出贯穿 AI 发展的恒定规律:人工预设领域规则、植入人类先验知识的定制化研发模式,能够在短期内产生可观性能效果,且便于人为把控研发流程;但从长期迭代视角来看,此类模式存在明确增长上限,极易陷入性能瓶颈,最终会被依托大规模算力、自主搜索、经验试错的通用技术方案所替代。国际象棋、计算机视觉、语音识别、传统自然语言处理等多个细分领域的技术迭代,均完整印证了这一发展逻辑。
文献明确区分了两类 AI 研发路径的本质差异:一类是以人类认知为依托的静态赋能模式,依赖研究者输入专业知识、制定场景规则;另一类是以算力与自主学习为依托的动态进化模式,依托机器自身搜索、试错、迭代积累能力。Sutton 在原文中强调,摩尔定律驱动下的算力指数级增长,是 AI 技术迭代的外部条件,能够适配规模化、通用化的学习与搜索方法,而人工定制化方案无法跟随算力扩张实现持续升级,这也是其逐步被行业淘汰的原因。
该文献的主旨并非否定人类知识的价值,而是阐释 AI 长期发展的演进逻辑:可规模化、可自主迭代的通用技术路径,远比短期高效、人工定制的专属技术路径更具备长期生命力,这一规律不受场景、算法迭代形式影响,是 AI 行业发展的共性特征。
二、LLM 对《苦涩的教训》的半贴合困境
大语言模型(LLM)的规模化普及,被行业普遍视作贴合《苦涩的教训》规律的技术突破,也是当前 AI 产业应用的主流范式。从技术迭代逻辑来看,LLM 确实摆脱了传统 NLP 领域人工编写语言学规则、定制场景逻辑的研发模式,依托海量互联网文本数据、超大参数规模与算力堆叠实现能力跃升,契合文献中“算力规模化优于人工知识植入”的基础逻辑,这也是其能够快速替代传统 AI 技术、实现全域应用的原因。
但结合《苦涩的教训》完整理论体系与 Sutton 后续公开研究、演讲观点来看,当前 LLM 范式并未完整践行文献逻辑,存在天然的路径局限,也是其难以通往通用超级智能的原因。LLM 的能力迭代完全依托人类已有的文本数据、知识体系与认知成果,模型训练、微调、对齐的全过程,均是对人类既有知识的归纳、重组、复刻与转述,本质仍是对人类先验知识的规模化运用,并未脱离人工知识赋能的底层框架。
相较于文献推崇的“自主经验学习、无先验知识探索”的通用路径,LLM 不具备部署后的动态迭代能力。模型完成训练上线后,参数与认知体系即固定成型,无法通过与用户、真实环境的实时交互积累全新经验、摸索未知规律,不存在自主拓展认知边界的可能。其能力上限完全被人类现有知识边界锁定,无法突破已有认知、生成全新知识体系,与《苦涩的教训》倡导的长期进化逻辑形成本质背离。
2026 年 5 月,Sutton 在麻省理工学院 Dertouzos 杰出讲座中进一步明确该矛盾:LLM 是 AI 规模化发展的阶段性成果,贴合算力迭代趋势,但并未实现真正意义上的自主学习,属于《苦涩的教训》规律下的“半完成形态”,无法成为 AGI 的终极路径。同年世界人工智能大会(WAIC)演讲中,Sutton 再次界定 LLM 行业定位,提出其合理角色是承担知识整理、解读、传播功能的“超级百科全书”,而非具备自主探索、进化能力的超级智能。
三、静态知识复刻与动态经验智能的范式割裂
结合 Sutton 提出的“大世界视角(Big World Perspective)”理论,可进一步拆解 LLM 的底层局限。该理论指出,真实世界的复杂度、丰富度远超任何 AI 模型的承载上限,同时包含多元独立心智与海量未知规律,不存在能够穷尽所有信息、掌握全部规律的人工智能。
LLM 的研发逻辑试图通过无限扩张参数规模、堆砌海量文本数据,实现对人类社会知识体系的全域覆盖,本质是试图用静态数据拟合动态、复杂、无限的真实世界。这种模式存在天然逻辑缺陷:文本数据是人类认知的静态沉淀,无法覆盖真实场景的动态变化、隐性关联与未知规律,模型的拟合行为只能复刻既有认知,无法实现探索式创新。同时,过度依赖静态数据拟合,还会引发模型幻觉、认知失真、逻辑偏差等一系列行业共性问题。
与之相对,《苦涩的教训》推崇的强化学习经验范式,复刻生物的自然学习逻辑,依托智能体与环境的持续交互、试错、迭代,自主拆解任务、积累经验、构建认知。该范式不依赖人类先验知识,仅依托基础规则与算力资源,即可自主摸索未知规律、生成全新能力,完全贴合文献中“通用方法、规模化迭代、无人工知识桎梏”的要求。
这一范式差异,是当前 AI 行业路线分流的依据。AlphaGo、AlphaZero、MuZero 等经典强化学习模型,均验证了经验学习的可行性:无需人类棋谱、场景经验等先验知识,仅通过自我博弈、环境试错,即可突破人类能力上限,摸索出人类从未掌握的策略与规律,贴合《苦涩的教训》的长期发展逻辑。
四、范式迭代趋势:从知识复刻到经验生长的行业转向
基于对《苦涩的教训》的解读,以 Sutton 为代表的一众顶尖 AI 学者,已开启行业范式转型,集体脱离传统 LLM 研发路径,深耕强化学习自主经验智能赛道。2026 年 7 月,Sutton 与合作者创立 Oak Lab,依托自研 OaK 架构(Options and Knowledge),打造可实时迭代、自主探索的通用智能体,完全遵循经验学习、动态进化的研发逻辑。
该架构设计严格对标《苦涩的教训》原则,摒弃人工领域知识植入,坚持全域通用、经验驱动、奖励导向的研发逻辑。智能体可在运行过程中自主生成行为策略、积累环境认知、搭建世界模型,通过开放式迭代持续拓展能力边界,摆脱静态数据与人类知识的双重桎梏。
行业层面已形成规模化路线转型趋势。Sutton 学生、AlphaGo 设计者 David Silver 于 2025 年底创立 Ineffable Intelligence,以 10 亿美元种子轮融资深耕强化学习赛道,坚持“无人类先验、自主经验探索”的技术理念,与 Oak Lab 形成技术呼应。与此同时,图灵奖得主 Yann LeCun 等顶尖学者也纷纷布局非 LLM 范式,探索基于世界模型、自主学习的全新 AI 路径,标志着 AI 行业正式告别 LLM 单一主导格局。
五、客观审视:范式优劣与行业发展边界
基于《苦涩的教训》的客观推演,LLM 范式存在明确的能力边界,但并非技术缺陷。在知识整合、文本生成、通用服务、场景应用等领域,LLM 依托规模化数据与算力优势,具备不可替代的实用价值,仍是当前 AI 产业应用的主要载体,未来将长期存在于 AI 生态体系中。
强化学习经验范式虽贴合 AI 长期进化逻辑、契合经典文献规律,但现阶段仍存在工程化应用难题。灾难性遗忘、可塑性丧失等深度学习固有问题,制约着持续学习智能体的规模化应用;同时,开放场景奖励信号稀疏、环境复杂度高、试错迭代算力成本高昂等问题,也让该范式的商业化应用面临诸多挑战,长期可行性仍需行业持续验证。
从七十余年 AI 发展规律来看,LLM 是行业迭代的阶段性成果,而非终极形态。《苦涩的教训》揭示的发展逻辑不会因技术迭代而失效:所有依托人类先验知识的静态 AI 范式,终将被可自主迭代、可规模化进化、可生成新知的动态范式所替代。未来 AI 行业将形成双轨并行格局,LLM 承担静态知识服务功能,强化学习自主智能体承担动态探索与创新功能,共同推动 AI 技术持续演进。
参考文献
The Bitter Lesson
http://www.incompleteideas.net/IncIdeas/BitterLesson.htmlA Vision of SuperIntelligence from Experience
https://sungsoo.github.io/2025/08/23/vision-of-superintelligence.htmlWelcome to the Era of Experience.pdf
https://storage.googleapis.com/deepmind-media/Era-of-Experience /The Era of Experience Paper.pdfThe Big World Hypothesis and its Ramifications for Artificial Intelligence
https://openreview.net/pdf?id=Sv7DazuCn8
—“We Must Act Now”: Sixteen Nobel Laureates Join Leading Economists and AI Researchers in Call to Prepare for AI’s Economic Transformation - Stanford Digital Economy Lab
https://digitaleconomy.stanford.edu/news/wemustactnow/10 亿美元种子轮!AlphaGo 之父出山:另辟蹊径,绕过大模型探索超级智能
https://mp.weixin.qq.com/s/UFutdoxE6XthGRY59_vavw强化学习之父、年近七旬的 Richard Sutton 宣布创业,称向 LLM 范式宣战
https://mp.weixin.qq.com/s/cUog1qtUw6_3TNKZwnzmSw强化学习之父萨顿中国演讲:大模型无法成为超级智能,真正的 AI 还在后面
https://mp.weixin.qq.com/s/GX5C4L7cpM_wmzkOtbb1dQ