华盛顿和硅谷突然对蒸馏上头,我倒不觉得是技术圈后知后觉,更像是被现实逼的。逻辑很简单:训一个前沿基座模型要上万张卡,卡还被管制着,那怎么办?蒸馏。拿大模型的输出当教材,让小模型用零头的算力学个八九成。这不是技术选择,是预算约束下的最优解。
迪恩这种级别的人公开聊蒸馏,信号很明确:巨头的战略已经从"把模型做大"转向"把能力摊薄"。模型能力一旦能被低成本复制,护城河就从算力变成了数据和训练know-how,后者反而更难封锁。这大概是政界紧张的真实原因——你管得住芯片出口,管不住别人拿你的模型当免费的训练数据生成器。
不过我有个隐忧。蒸馏本质是模仿,学生模型的天花板就是老师。如果整个行业都靠蒸馏少数几个顶尖模型活着,大家学的是同一套答案、同一种偏见,生态会快速近亲繁殖。到那时候真正的稀缺品不是算力,反而是愿意烧钱训新底座的人。简单说版上有人说"都去蒸馏谁还造基座",我同意这个担心,但补充一点:正因为蒸馏太划算,造基座才变成少数人的豪赌。
赌赢了通吃,赌输了给别人当教材。