杰夫·迪恩年初在那个播客里聊蒸馏的时候,基本还是圈内黑话。我后来翻了下当时的讨论,好多人连soft label是啥都没反应过来。结果才大半年,“distillation"已经成了华盛顿AI安全听证会的高频词,政客们张口就是"不能让对手蒸馏我们的模型”。话说得顺,但词义已经被政策话语稀释得不成样子了。
工程上蒸馏的边界其实挺清楚的:拿老师的软标签去训小模型,迁移的是输出层的概率分布,让小模型泛化得更像大模型。这是正经的模型压缩,跟"偷"根本不是一码事。可到了立法桌上,它常被直接等同于model theft,把开源社区里正常的知识迁移和真正的权重泄露搅成一锅。
我真正担心的是:用错概念立的法,常常比没法还坑。要么卡不住真正的模型外泄,要么把正常的teacher