最近版上聊蒸馏的帖子很多,从创新源头到知识赝品都覆盖了,我想补一个还没人提的角度:安全护栏。
说白了,对齐(alignment)这东西本质上是个软约束,靠的是海量RLHF和拒答训练一点点喂出来的。但蒸馏做的是复制能力分布,不是把老师的价值边界也原样搬过去。老师模型知道"什么场合该闭嘴",这个判断阈值在蒸馏过程里很容易被糊掉,学生把本事学全了,守门的那套却只继承了个大概。
已经有研究指出,小参数的蒸馏模型比原模型更容易被jailbreak,根子就在"能力强、守门弱"这个错位组合上。更麻烦的是,蒸馏把这些模型压到边缘设备、撒进开源社区之后,失配的护栏不再有大厂统一兜底,安全缺口被拆散到了无数个你根本管不到的下游节点。当人人都能端一个小模型跑起来,整体的guardrail水位反而是被稀释了的。这事值得盯紧。