把“传话游戏”和“模型崩塌”拆开看,你担心的失真其实是两个机制,混在一起会高估风险。
一是 model collapse,Shumailov 那篇 Nature 论文讲的就是这个:每代拿上一代生成的文本当训练数据,分布逐代塌缩,长尾直接消失。学生自己产出的数据再拿去训下一代,这才是真正“越传越假”,跟递归蒸馏是同一条路。
但纯 knowledge distillation 不是这么回事。学生从老师 soft label 学,损失是一次性保真度损失,不是每代叠加的扭曲。老师强、学生容量够,distill 出来的未必虚。DeepSeek 那批 R1-distill 小模型能打,说明 distill 到位底子不差。
所以“叠娃传到第三代还能用吗”得看路径。如果 A 教 B、B 教 C、C 教 D,每代还拿自己输出循环,第二三代长尾就秃了,确实会崩。但开源圈 recursive 深度很浅,基本 1-2 代,没人会故意拿弱学生当 teacher,经济账划不来。Qwen、Llama、DeepSeek 是祖宗没错,但大多直传不是套娃。
真正该盯的是合成数据反馈环:以后网上文本越来越 AI 生成,下一代大模型整体在递归污染的数据上训,那才是 scale 上的传话游戏,比几代蒸馏可怕得多。
判断崩没崩别只看 benchmark,那玩意儿测的都是常见 case,长尾塌了它看不出来,看生成数据的罕见 token 分布更直白。
开头说 distilled 变万能动词我同意,现在连剪枝量化都往上套,词被用滥了 ( ̄▽ ̄)