AI 公司批量抢购 2022 年前的旧书:互联网被 AI 污染后,干净语料成了最后的矿脉
2026 年出现了一个反常信号:多家海外 AI 公司正通过中间商批量收购2022 年之前出版的旧书,扫描成数据之后,把实体书直接销毁。收购方给出的理由惊人一致:2022 年 11 月 ChatGPT 爆火之后,互联网上新增的内容已经有超过一半出自 AI 之手,继续用今天的网络数据训练下一代模型,等于让模型吃自己吐出来的东西。
这不是收藏癖,也不是怀旧生意,而是为了给下一代大模型找一块"没有被 AI 污染过"的训练语料。旧书是这场争夺的第一个显性战场,接下来的候选人还有档案馆、论文预印本、专利文献和地方志——每一块尚未被 AI 生成内容侵蚀的土地,都在被重新估值。
这个判断正在被越来越多的研究和实测数据证实,而且问题比"数据质量差"严重得多。它不是偶发的坏样本,而是统计学意义上的系统性退化,研究者给它起了个名字:模型崩塌(Model Collapse)。
先看一组公开研究的数字。2023 年,Shumailov 等人在论文《The Curse of Recursion》里做了最直接的实验:用模型自己生成的文本训练下一代模型,再让下一代生成文本训练第三代,几轮迭代之后,模型输出的多样性断崖式下降,错误被逐代放大并固化,罕见知识和长尾内容最先消失。
2024 年,同一团队把结论发上 Nature,并把实验推得更远:即便每一代训练时混入10%的真实人类数据,模型依然无法阻止退化,只是退化的速度被拖慢了。换句话说,污染不是"有或无"的问题,而是"比例"的问题——只要训练数据里 AI 生成内容的占比够高,退化就只是时间问题。
要理解这件事,先要理解模型崩塌的三个机制,它们分别作用于分布、方差和错误传播。
第一个机制是分布偏移。大模型学到的不是"真实世界",而是训练数据的概率分布。当训练数据里混入模型自己的输出,原始分布中本来就高频的"平均内容"会被进一步放大,而低频但重要的"长尾知识"——冷门历史事件、罕见病症、地方语言、小众技术细节——会被逐步稀释。
第二代模型眼里的世界比第一代更单调,第三代模型眼里的世界更单调。迭代十次之后,模型记住的只剩"最典型的平均值",而平均值恰恰是最没有信息量的东西。
第二个机制是方差收缩。模型生成文本时,每个 token 的选择都带概率性,可一旦生成结果反过来成为训练数据,这种概率性就会被反馈回路抹平。输出越来越贴近众数,越来越缺乏意外,模型从"会说话"退化成"只会说正确但无用的套话"。
一个被污染过的模型写代码,可能给出语法完全正确、边界条件全部漏掉的实现,因为它见过的"标准写法"被反复强化了。这不是风格偏好问题,而是概率分布被压缩后的必然结果。
第三个机制是错误固化。幻觉在单次生成里只是偶发噪声,但一旦进入训练集,它就从噪声变成"事实"。下一代模型会虔诚地重复这个错误,并在重复中给错误补上更多细节,让它看起来更可信。
这也是为什么 AI 生成内容的检测难度逐年上升:不是检测算法变差了,而是污染语料里的"伪事实"越来越逼真了。把三个机制叠在一起,模型崩塌就不是"可能发生的风险",而是"必然发生的数学结果"——除非训练数据里有足够比例的、来自真实世界的干净信号。
旧书恰好提供了这个信号,而且提供了两层保护。
第一层是编辑质量。一本书从写作、编辑、校对到出版,通常经历三到五轮人工审校,错误率远低于任何网页内容,更不用说 AI 生成内容。第二层是时间锚点:2022 年之前的出版物,在物理上就不可能与 AI 生成文本重叠,用时间做锚点,比任何质量过滤器都可靠。
这也是为什么"扫描后销毁实体书"会变成行业潜规则——这些书是语料层面的稀缺资产,持有方不希望它被竞争对手二次获取。数据战争已经打到了旧书市场。
对比一下几类语料来源,差距一目了然。
| 维度 | 2022 年前旧书 | 2022 年后网络内容 | 合成数据 |
|---|---|---|---|
| 人类创作占比 | 100% | 不足一半 | 0% |
| 专业编辑校对 | 3-5 轮 | 无 | 无 |
| AI 污染风险 | 无(时间锚点) | 高 | 本质即 AI 输出 |
| 长尾知识密度 | 高 | 低 | 极低 |
| 获取成本 | 高(扫描+清洗) | 低 | 极低 |
| 对模型质量的贡献 | 稳定正向 | 逐年衰减 | 双刃剑 |
注意表格最后一行:合成数据是双刃剑。不是说 AI 生成的数据一律不能用,而是要看它被用在什么地方。代码、数学推理这类"答案可验证"的领域,高质合成数据反而能显著提升模型能力,因为错误可以被程序自动筛掉——DeepSeek R1 系列、OpenAI o 系列的后训练都大量使用合成推理数据,效果是正面的。
但在开放式文本领域,合成数据没有天然的纠错机制,错误会顺着概率分布悄悄渗透。同样是合成数据,用在推理链路里是燃料,用在语料池里是毒药。这个区分,是 2026 年数据工程最重要的认知之一。
还有一个容易被忽视的现实:网页比书籍更容易被污染。2023 年以来,大量内容农场和 SEO 站开始用生成式 AI 批量生产文章,一篇 2000 字的"深度分析"几分钟就能炮制出来,挂上广告位等流量。这些站点表面看是正常网页,实则整页都是低质量 AI 输出,爬虫分不清,但语料工程师看一眼来源域名就知道该不该要。
相比之下,书籍的出版门槛天然过滤掉了这批内容——这就是时间锚点之外,旧书的第二重保护。而 2026 年新出版的书籍,已经开始混入 AI 辅助写作的内容,时间锚点正在从"2022 年前"向更早滑动。
污染不是停留在论文里的理论,而是已经在真实语料里发生的趋势。Common Crawl 是目前公开可获取的最大网页语料库,多个研究团队对它的历年快照做抽样检测,结论一致:AI 生成文本的占比在 2022 年之后逐年抬升,到 2026 年已经成为快照里不可忽视的组成部分,而这部分内容正是大多数开源模型训练数据的原料。
更麻烦的是,污染会自我加速。一篇 AI 生成的"参考文章"被爬虫收录,下一篇 AI 文章会引用它作为"事实来源",两个错误的中间态被互相背书,最终在语料里沉淀成看起来无懈可击的伪常识。检测这类伪常识,比检测语法层面的 AI 痕迹难一个数量级。
行业里已经出现了一系列对抗污染的公开动作。Reddit 在 2024 年就开始向 AI 公司收取 API 数据授权费,把社区里的人类对话当成资产定价;维基百科社区反复讨论如何限制 AI 生成内容的编辑权限;Cloudflare 推出专门的对抗机制,用伪造页面诱捕 AI 爬虫,让它们把算力浪费在假内容上。
这些动作的共同本质是同一件事:内容平台开始意识到,自己手里"由人类生产的内容"才是真正的护城河,而允许 AI 公司免费抓取,等于把护城河拆了卖给对手。内容授权从灰色地带走向正规市场,只是时间问题。
对大多数团队来说,现实问题不是"要不要用合成数据",而是"如何保护自己手里的干净数据,以及如何判断外部语料干不干净"。数据治理有四个可落地的抓手。
第一是去重。MinHash 等近似去重算法能在亿级文档里找到重复内容,网络爬取的语料经过 MinHash 去重后,通常能减少30% 到 50%的冗余,而去重掉的大多是搬运、转载、聚合类内容——它们恰恰是 AI 污染扩散最快的载体。
第二是溯源标注。给每一份语料记录来源、采集时间、许可证,形成数据血缘,训练出问题时能快速定位是哪一批数据引入了偏移。C2PA 等内容凭证标准正在把"是否 AI 生成"变成元数据的一部分,未来的语料审计会像今天的代码审计一样常规。
第三是质量过滤。用困惑度(perplexity)分布、启发式规则、人工抽检三层漏斗清洗语料,把疑似 AI 生成的"平均文本"挡在训练集之外。第四是保持人类信号的比例——Nature 那篇研究的结论很直接:真实人类数据在训练集中的比例,直接决定模型退化的速度,这个比例不是可有可无的调参项,而是生死线。
实操层面,给语料做"污染体检"并不需要多贵的工具。先用 datasketch 这类开源库跑一遍 MinHash 去重,把重复率记下来;再按困惑度从低到高排序,人工抽查最低的那一批——它们往往是模板化的 AI 输出;最后给来源域名建一张信誉表,内容农场和 AI 聚合站直接降权。三步做完,一份语料的质量画像就出来了。
还要警惕一条隐蔽的污染路径:蒸馏。用大模型生成数据去训练小模型,如果大模型本身已被污染,蒸馏会把错误原封不动地继承下来,甚至因为小模型容量更小,错误占比更高。蒸馏可以压缩规模,但无法净化质量——数据源头不干净,下游所有环节都会跟着脏。
所以整个链条的结论收敛到一句话:训练数据的干净程度,是模型质量的最后一道物理底线。这道底线不靠模型架构解决,不靠后训练解决,只能靠数据工程解决。
下面这个代码块用最小模型模拟"自噬训练"的退化过程,你可以在本地直接运行,亲眼看到方差是如何一代代收缩的。
把代码里的常数换成真实世界的参数,结论方向不会变:只要每一代混入的 AI 输出比例超过阈值,模型的表达能力就会一代代萎缩,直到所有输出都收敛到同一个"安全答案"上——而安全答案,通常意味着平庸。
# 模拟模型崩塌:每代用上一代输出重新训练,观察方差收缩 import numpy as np rng = np.random.default_rng(42) def sample_docs(mu, sigma, n=2000): """从高斯分布采样文档向量,模拟语料分布""" return rng.normal(mu, sigma, size=(n, 2)) def fit_and_sample(data, n=2000): """用当前语料拟合新模型(估计均值方差),再采样下一代语料""" mu = data.mean(axis=0) sigma = data.std(axis=0) * 0.9 # 模型输出比训练集更"平均" return mu, sigma, sample_docs(mu, sigma, n) mu0 = np.array([0.0, 0.0]) sigma0 = np.array([1.0, 1.0]) data = sample_docs(mu0, sigma0) print("第0代标准差:", np.round(data.std(axis=0), 3)) for gen in range(1, 7): mu, sigma, data = fit_and_sample(data) print(f"第{gen}代标准差:", np.round(sigma, 3), "均值:", np.round(mu, 3))运行结果会看到:每一代的标准差都在收缩,第六代的标准差只剩初始值的四成左右,分布越来越"窄",长尾被系统性吃掉。这个二维模拟当然远不如真实大模型复杂,但它揭示了同一个数学方向:反馈回路会把多样性磨平。
理解了模型崩塌,再看 2026 年的旧书抢购潮,就不再是猎奇新闻,而是一场关于"语料主权"的提前布局——谁手里的干净语料多,谁的下一代模型就能少退一步。
对普通开发者来说,有三件现在就能做的事。第一,把你自己的私有数据当成资产管理起来,版本化、备份、标注来源,别等训练时才想起来数据散落在各处。第二,接外部语料时先跑一轮 MinHash 去重和困惑度过滤,哪怕只是几百 MB 的微调集,也能挡住大部分 AI 污染。第三,关注数据血缘工具链,把"这份数据从哪来"变成工程规范,而不是某个人的责任心。
对企业而言,语料治理应该从"成本项"重新定位为"模型质量杠杆"。同样的模型架构、同样的算力预算,语料干净程度不同,最终效果可以差出几个百分点,而这几个百分点在 benchmark 排行榜上就是名次的差距。
AI 行业的军备竞赛已经打到第三层:第一层拼模型架构,第二层拼算力,第三层拼数据质量。前两层拼的是钱,第三层拼的是眼光和纪律。
当互联网上过半的新内容都出自 AI 之手时,"找到人类原生的高质量数据"本身就是一种核心竞争力。而 2022 年这个时间锚点,会随着时间推移变得越来越珍贵,因为每一年的新出版物,都携带着更高比例的 AI 生成痕迹。
沿着这个方向往下看,人类数据正在变成一种可以定价的资产。新闻集团的档案库、图片库的授权照片、代码托管平台的优质仓库,都已经出现在 AI 公司的采购清单上,价格由稀缺度决定。未来三到五年,"AI 生成"与"人类生成"的认证会成为数据基础设施的一部分,就像今天的 HTTPS 证书一样普及。
这对内容生产者的启示是反直觉的:当机器能批量产出文本时,人类原创内容不会贬值,反而会升值。你写的每一篇深度文章、每一段真实经验、每一份独有数据,都是模型训练需要的稀缺信号。
这不是末日预言,而是数据经济里最朴素的一条规律:稀缺性决定价值。当干净语料成为稀缺品,最先意识到这一点并建立数据治理体系的团队,会在下一轮模型竞争中拿到别人拿不到的先手。现在动手整理你的数据资产,就是在为三五年后的模型质量下注。