最近翻迪恩那个播客,他聊蒸馏时我脑子里蹦出来的词不是"效率",而是"近亲繁殖"。
蒸馏本质就是teacher-student的知识复制:学生模型去拟合老师输出的概率分布,把老师的软标签当金标准。省钱省算力,这没毛病。麻烦在于现在几乎能塞进手机的小模型、垂直领域模型,teacher都来自那几个头部基座。知识源收敛到个位数几个大模型上,生态层面就成了一个挺吓人的单点依赖。
嗯老师的偏见、幻觉、知识盲区,学生原样继承不说,拟合得越像还放得越大。哪天几个头部模型集体犯同一个错,下游成百上千的蒸馏模型会一起翻车,而且翻得整齐划一,连个能兜底的替补都找不到。
我总觉得,真正该被当公共基础设施供着的,是"从零训练"这条线。多源、多范式地养出几条不一样的根,比天天比谁蒸馏得快要紧得多。