过去两年,大模型能力的跃升几乎都被归功于同一件事:参数更多、算力更强、喂进去的文本更多。但一个更现实的问题正在浮出水面——互联网上可供训练的高质量文本,快被用完了。

Epoch AI 等机构的研究团队曾做过估算:如果保持当前的训练规模增速,公开可获取的高质量文本数据可能在 2026 至 2032 年之间被消耗殆尽。这被称为“数据墙”。它并不意味着互联网没有数据,而是说那些经过筛选、语法规范、逻辑连贯的“好数据”已经接近上限。

数据墙的三重压力

第一重来自版权。多家媒体与出版机构对模型公司提起诉讼,要求为训练数据付费,一些平台也开始收紧甚至屏蔽爬虫。第二重来自商业壁垒。社交平台、电商与内容社区意识到数据本身的价值,纷纷把语料锁进自家围墙,不再对外开放。第三重来自结构限制。全球网站数量虽多,但真正的高质量文本高度集中在少数几个站点,且增长速度远慢于模型参数与训练 token 的膨胀速度。

当真实数据供给跟不上需求,合成数据自然成为替代方案。所谓合成数据,是指由模型自身或专门的数据生成流程制造出来的训练样本,包括问答对、推理链、代码片段、对话记录等。

合成数据已经无处不在

它并不是新鲜事物。今天主流模型的后训练阶段,几乎都离不开合成数据:

换句话说,合成数据不是“备胎”,而是当前训练流水线里已经在运转的零件。

风险:模型会“近亲繁殖”

问题在于,用模型生成的数据再去训练模型,存在自我循环的风险。2024 年发表在《自然》上的一项研究给出了直观结论:当模型连续多代在自己生成的数据上训练时,输出会逐渐失去多样性,分布尾部被削平,最终出现不可逆的性能退化,研究称之为“模型崩塌”。

原因不难理解。合成数据本质上是模型对真实世界分布的一次采样,采样必然丢失长尾。若下一代模型只见过这个被压缩过的世界,它学到的就是失真版本;再下一代继续压缩,偏差层层累积,错误被当作事实固化下来。此外,合成数据还容易出现“幻觉自洽”——模型编造的内容在自我验证中被当作正确答案,形成闭环。

真正的解法不是替代,而是配比

业界的共识正在逐渐清晰:合成数据的价值在于放大,而不是取代。可行的做法有几点。其一,严格控制真实数据与合成数据的配比,保留足够的“锚点”以维持分布真实。其二,优先在可验证领域使用合成数据——数学、代码、形式化推理有客观判据,可以有效过滤错误。其三,引入验证器与强化学习,让模型在生成与筛选之间反复迭代,而不是简单地把生成结果直接喂回去。其四,把目光投向尚未被充分开采的数据形态:专家标注、企业私有语料、多模态视频与音频、机器人与传感器采集的交互数据。

数据的稀缺,正在改变行业的竞争逻辑。过去拼的是谁能买到更多卡、谁能爬更多网页;接下来拼的可能是谁能更高效地“炼”数据——在有限的真实数据上做出更好的筛选、配比与合成。当“石油”不再唾手可得,炼油厂的工艺水平,才是真正的护城河。