当高质量人类语料逐渐被“开采”完毕,合成数据不再是权宜之计,而是新一代模型训练的基础设施。它成本低、可控、可规模化,却也把一个尖锐问题推到台前:用模型生成的数据训练模型,会不会越练越差?
从备选到刚需:合成数据为何上位
真实数据面临版权、隐私、采集成本与长尾稀缺等多重约束,尤其在代码、数学推理、多轮对话等场景,人工标注难以覆盖规模。合成数据可以按需生成特定难度与分布的样本,还能用于冷启动、指令微调与强化学习中的反馈构造。当数据需求增速超过可获取的真实语料增速,合成数据自然成为默认选项。
模型崩塌:一个自我强化的退化循环
所谓模型崩塌,指模型在多代使用自身或同类模型输出训练后,逐渐丢失原始数据分布中的尾部信息,输出趋于同质,错误被放大并代际累积。它并非必然发生,但一旦缺乏外部约束,退化会像滚雪球一样自我强化。更隐蔽的是,这种退化在常规评测集上往往不易暴露。
崩塌的典型路径
- 分布收窄:采样偏向高频模式,罕见表达与少数群体语言逐步消失。
- 误差固化:生成数据中的错误被当作真值学习,下一轮继续放大。
- 多样性塌缩:输出风格趋同,模型逐渐失去探索与纠错能力。
- 评测失真:用同源数据评测同源模型,指标虚高掩盖真实退化。
治理路径一:守住真实数据的锚点
合成数据可以扩量,但不应完全替代真实数据。实践中通常保留一定比例的真实语料作为“锚”,并确保其在关键能力维度上持续更新。真实数据的价值不在数量,而在于它携带了模型无法自行发明的分布边界。
治理路径二:溯源、过滤与多样性约束
为合成样本建立来源标记与版本记录,是治理的前提;没有溯源,就无法判断数据来自哪个模型、哪一轮生成。在此基础上引入质量过滤、去重与多样性约束,避免单一模型主导整个数据池。混合多模型、多提示策略生成,也能降低同源偏差。
治理路径三:把评测与监测做成常态
评测集应与训练数据保持隔离,并保留一部分从未参与训练的真实数据用于回归检测。对多代迭代的模型,需持续监测分布偏移、输出熵与长尾能力变化,一旦发现退化趋势及时回滚或补充真实数据。治理不是一次性动作,而是贯穿训练全流程的机制。
结语:刚需之下更需要纪律
合成数据解决了数据稀缺,也带来了新的系统性风险。真正的解法不是拒绝合成,而是把它放进有锚点、有溯源、有监测的框架中。谁先建立起这套纪律,谁就更可能在下一轮模型竞赛中保持稳定。