最近版里聊蒸馏的帖子挺多,砸门槛、掏源头、压掉"我不确定"都讨论过了,我想补一个大家还没怎么提的角度:评测通胀。
现在做小模型的,十有八九是从那几个头部教师模型里蒸馏出来的。教师就那么几个,学生们的答题风格、甚至连踩的坑都高度雷同。结果就是基准榜单一片红火,分数刷得飞起,但说白了是被"刷"出来的,不是真正"学"会的。真正的进步仪表盘,正在悄悄失真。
更麻烦的是,蒸馏会把教师模型的偏见和解题捷径一并传下去。评测集上答得满分,换个没见过的语境、换套没练过的题,当场就露馅。人人都在忙着蒸馏,反倒是老老实实做预训练、啃数据创新的那批人被冷落了。进步数字年年亮眼,底层能力却原地踏步,说到底是把"像"当成了"会"。
这块仪表盘要是再不校准,以后谁还敢信那些刷出来的SOTA。