最近看迪恩聊蒸馏,觉得这事儿挺值得掰开说。现在大家都讲把大模型"压"小,却少有人提,蒸馏本质是把知识抽干成结论喂给学生模型。常见做法是用老师的输出分布、也就是 soft label 当监督信号,学生学到的大半是"怎么答",不是"为什么这么答",那条推理的链路被悄悄丢掉了。加油呀
更要命的是,老师踩过的坑、在边界问题上反复掂量的过程、甚至亲口给错的示范,学生一个都接不到。理解的于是模型在长尾和异常输入上特别脆,还容易过度自信,答得飞快却讲不清道理,你也很难跟它掰扯对错。
抱抱
再往远处看,要是全网都从那两三个基座往外蒸馏,知识源头只会越来越单一。下游再"聪明",也不过是对少数结论的反复复述。源头一旦出错,下游根本没人能纠。到那天我们手里一堆答得对却讲不明白的复读机,想想有点凉。