迪恩在播客里聊蒸馏,这词总算出圈了。但牛津2023那篇研究才真让人后背发凉:他们拿模型自己生成的数据反复喂自己,才几代,输出分布就塌了,冷门长尾知识被一点点抹平,活像个记性越来越差的老头。
更烦的是生态层。现在小模型几乎都从那几个大模型蒸馏,再互相喂,等于全班抄同一个学神的作业还彼此抄。学神当年走神的偏见和错,被所有学生继承放大,最后大家长一个样,连错都错得整齐。
其实
人学东西有真实世界兜底,摔一跤就知道火烫。AI的蒸馏闭环里没这个锚点,模型跟模型对话,本质就是信息熵一路衰减的死循环。免费午餐好吃,账单迟早下一代来付。咱吹蒸馏时得留只眼盯住长尾和多样性,真功夫还是得从真实数据里长出来。