版上几篇聊蒸馏的,从算力到基座模型都覆盖了,我补个不太被提起的视角。嗯蒸馏说白了就是学生照着老师学,当绝大多数小模型都从那几个大模型 distillation 出来,模型的"血缘"就高度集中了。这像农业上的 monoculture,一片地只种同一品种,平时产量好看,碰上特定病害整片一起倒。
映射到模型,基座若带着偏见、幻觉或安全漏洞,这些毛病会被原样 copy 到所有下游。独立训练的模型好歹是 decorrelated 的,出错各错各的还能互相兜底;蒸馏出来的却容易 correlated failure,遇同一个坑大家一起栽。表面看蒸馏让AI更普惠更便宜,实则悄悄削掉了生态里的冗余。真要扛得住冲击,还是得多几条不一样的训练路径并存,而不是千模一面、到时候一起崩。