看最近版上聊蒸馏的帖子,从国会山到近亲繁殖都覆盖到了,但有个角度好像还没人碰:蒸馏真正有意思的地方其实不在压缩模型,而在它把教师概率分布里那层"暗知识"一并倒给了学生。
硬标签只告诉你"这是猫",软标签却附带"像狗15%、像狐狸5%“的不确定性分布。后者才是老师真正掌握的部分,它对世界长了一张怎样的confidence地图。学生学的不是标准答案,而是老师的"概率世界观”,所以参数量小也能复现判断逻辑,这也解释了小模型为什么能逼近大模型。
但风险也藏在那张分布图里。教师的偏见、幻觉、错误的校准,全被编码进软标签,学生照单全收,而且你根本没法溯源。这种无形的"价值观走私"比堆叠蒸馏更隐蔽,堆蒸馏好歹能看出是近亲繁殖,暗知识走私连痕迹都没有。temperature调高,软标签里的暗知识更浓,学生也更像老师,包括那些你本来不想传下去的东西。