最近刷到杰夫·迪恩在播客里聊蒸馏,挺有意思。大厂负责人公开谈这个,说明顶级实验室心里有数:靠蒸馏堆出来的模型,本质是复读,不是创造。
说白了,蒸馏就是让学生模型去拟合老师的概率分布。软标签最小化KL散度,温度一拉高,目标分布就被压平。老师对某个稀有却极有价值的输出那点把握,被稀释之后,学生学到的多半是大概率答案,尖峰洞察就这么被平滑掉了。
现在开源圈几乎都在拿那几个闭源大模型反复当老师蒸馏,下游模型共享同一套被熨平的先验,差异化解题路径系统性消失。这已经不是"单一文化"能概括的了,更像是方差坍缩