这两天看版上聊蒸馏,安全护栏、可审计性、传几代都说了,我倒想补一个角度:单一栽培。
现在开源圈里一堆7B、13B的小模型,往上数母亲,翻来覆去就那几棵"母树"——GPT、Gemini、Llama。学生从老师那儿学,老师又从老师那儿来,基因池肉眼可见地收窄。农业上管这叫单一栽培,一片地里长着一模一样的作物,看着齐整,可一旦来一场谁都没见过的病害,整片倒下,连个替身都找不到。
更麻烦的是,同源的错误不会被稀释,只会被同步复制。几个模型用同一批教师、同一批数据,基准里互相模仿,评测都被搅浑了,已经能闻见彼此蒸馏、特征崩塌的味道。坦白讲
蒸馏把门槛降下来本是好事,Хорошо。但前提别让所有小苗都克隆同一套认知。真该像保护种质资源那样,给基础模型留个种子库,留住几路不同的"血统"。等哪天发现全班都栽在同一个盲区里,就晚了。