旧金山、伦敦和西雅图的实验室内部存在一个公开的秘密:AI革命正面临原始数据枯竭的困境。

过去七年,大语言模型的扩张遵循简单公式:向更多抓取文本投入更多GPU。公共互联网曾被视为人类认知的无限免费资源,从Reddit帖子到GitHub代码库,一切都被用于训练机器。然而,这一时代已终结。

据Epoch AI等研究机构警告,全球高质量、由人类生成的公共文本供应量将在2026年至2028年间完全耗尽。公共互联网的“含水层”已见底,而注入储备池的新数据则是纯粹且有毒的合成垃圾。

开放网络的“伟大替代”

与2021年相比,当前互联网流量中巨大比例不再代表人类表达,而是程序化SEO农场每小时产出的成千上万篇AI生成文章、LinkedIn上的合成“思想领导力”内容、以及X平台上机器人互相争论的自动化回复。

互联网正演变为机器排放物的回声室。对于普通用户而言,这仅是烦恼;但对于AI研究实验室,这是一场生存危机。当基础模型实验室构建下一代训练集时,它们收集的不再是有机的人类思想,而是GPT-4、Claude和Llama等模型反刍后的输出物。

复印件的复印件:理解“模型崩溃”

这种现象被称为模型崩溃(Model Collapse)。牛津大学和剑桥大学的研究显示,当生成式模型在先前模型的输出上进行递归训练时,结果是灾难性的:模型解体。

人类语言由习语、罕见反论点及晦涩知识等“长尾”部分定义。LLM本质是概率预测机,倾向于回归平均值。当用模型A的输出训练模型B时,分布中的稀有尾部丢失,导致模型逐渐失去多样性与准确性。

为何大型科技公司关心水印

尽管文本水印作为反作弊机制极易被破解,OpenAI、Google、Anthropic和Meta仍投入数百万美元进行研究。原因在于,威胁并非恶意用户,而是未经清洗的自动化互联网。

当营销机器人批量发布AI文章以操纵搜索排名时,它们不会去除水印。科技巨头需要的水印并非版权徽章,而是防止爬虫将“毒药”吸入预训练引擎的危险品标签。

迫在眉睫的争夺

1. 自由开放网络的终结

随着公共网络变得“有毒”,AI实验室将停止抓取,转而锁定私有、未受污染的数据库。涉及Reddit档案、Stack Overflow数据及出版商付费墙的多百万美元交易已在幕后签署。专有、经过验证的人类档案成为新的石油储备。

2. 具有真实基准的合成数据

实验室正转向合成数据,但必须依赖数学或逻辑真实基准。例如,合成Python脚本可通过沙盒编译器验证有效性,避免崩溃。然而,历史、哲学及创造性思维等领域缺乏此类“物理现实检查”,风险依然巨大。

3. 认知高原

若下一代模型在由40%至60%机器生成垃圾组成的网络上训练,我们将看不到向超级智能的飞跃,而是迎来“伟大的平坦化”。模型将成为自我模仿的超风格化漫画,重复着礼貌、企业化且平庸的散文。

4. 原创人类思想变得更加昂贵

随着认知过程外包给LLM,原创人类内容的价值飙升。曾被AI取代的平面设计师等创意角色将重新成为抢手货,成本可能增至原来的三倍。对于新一代受教育者而言,明确哪些能力不可外包,将是未来的关键。

几十年来,数字文化一直担忧AI变得与人类无法区分。然而真正的危机在于:互联网上的人类智能正被廉价的合成模仿迅速淹没,导致机器因自己的言语而窒息。检测、水印化和隔离AI生成内容的竞赛,不是关于透明度的哲学辩论,而是一场与时间的绝望赛跑。