最近看迪恩那期播客有点后背发凉。他聊蒸馏时轻描淡写,但背后事实挺吓人:现在绝大多数小模型的teacher就那么几家。开源圈一堆"自研"模型,扒开看训练数据,喂的全是同一两个前沿大模型吐的软标签。跟农业种单一作物一样,整片田同一个品种,抗病能力直接归零。
更麻烦的是盲区被成倍复制。teacher在哪些分布上没见过、哪些bias它自己都没觉察,学生全盘照收,还当学到了通用能力。等撞上分布偏移的corner case,下游一票人集体翻车,而且翻得整整齐齐。
其实最怕正反馈塌缩。从头预训练又贵又慢,蒸馏便宜省事,越来越少人愿自己从头炼。稀缺的模型多样性被捷径一点点吸干。等哪天发现teacher有系统性盲点,连个backup都找不到。
佛系归佛系,多样性这东西丢了再捡,成本比现在贵太多了。