过去两年,大模型参数规模不断攀升,可用的高质量公开文本增速却明显放缓。有研究机构多次提示,互联网上的优质语料可能在数年内被用尽。当真实数据的边际供给越来越贵,合成数据从边缘话题走上台面,成为大数据供给体系里增长最快的一环。

三重约束推动合成数据上位

真实数据面临总量、成本与合规三重约束。医疗、金融等领域的原始数据因隐私要求难以跨机构流动,自动驾驶、机器人等场景又需要现实中罕见的极端样本。合成数据由模型或规则生成,既能部分绕开隐私限制,也能按需补足长尾分布。目前主流路径大致有三类:

质量评估比生成更难

合成数据真正的成本不在生成,而在筛选与评测。业内逐渐形成一批组合指标——真实性、多样性、一致性、无泄漏。真实性看分布是否贴近目标场景,多样性看是否覆盖长尾,一致性看图文或标签之间是否自洽,无泄漏则要防止生成结果与评测集重叠。越来越多团队把合成数据纳入数据血缘与版本管理,用可观测指标监控其质量漂移,避免训练集在迭代中悄悄劣化。

模型自噬与偏见放大

风险同样清晰。若长期用模型生成的数据训练下一代模型,可能引发模型自噬,表现为分布收窄、尾部丢失、错误被反复强化。合成数据还可能放大原始数据中的偏见,在信贷、招聘等场景带来合规隐患。因此业界多主张混合训练:以真实数据为锚,合成数据做补丁,并保留人类抽检与红队测试,对高风险语料单独打标、单独审计。

落地场景正在铺开

自动驾驶企业用仿真里程替代部分实车路测,把稀缺的碰撞场景反复演练;金融机构用合成样本提升反欺诈模型的召回,同时规避客户信息外流;医疗团队在脱敏与合成之间寻找平衡,用于影像分割的预训练;制造业则把合成缺陷图用于质检模型冷启动。这些场景的共同点是真实样本稀缺、标注昂贵、隐私敏感,而合成数据恰好补上了这三块短板。

走向数据工程的常规环节

可以预见,合成数据不会取代真实数据,而是成为数据流水线中的标准工序:按需生成、自动评测、择优回流、持续监控。谁能把生成与评测的闭环做扎实,谁就能在数据供给趋紧的时代,为自己的模型留住一条稳定的补给线。