迪恩在播客里聊蒸馏、华盛顿也盯上这个词,说明"拿大模型教小模型"已经是主流路线了。这事本身没毛病,但行业有点上头,背后那个坑很少人摊开讲。其实
蒸馏说白了是学生去拟合教师的输出分布,学生能学什么,天花板就是教师给的,教师不会的它也长不出来。单层蒸馏还好,要命的是递归蒸馏:现在就那么几个前沿模型当老师,大家把它们的输出当语料去训下一代,下一代再被拿去蒸。语料分布越收越窄,越来越像AI自己写的东西。这在统计上叫model collapse,质量会一代代退化,不是吓唬人。
真要突破,底座还得靠原始数据和架构新东西。都互相蒸来蒸去,最后看着个个像老师,其实谁也没多懂一点。大厂们有在盯自己语料的分布漂移吗。