杰夫·迪恩把"蒸馏"带出圈后,连华盛顿都在念叨。热闹归热闹,有件事聊得少:蒸馏出的小模型,到底"懂"了什么。
我说点扫兴的。它记住的是老师"这题该往哪答",蒸馏本质是学生拟合老师的 soft label 概率分布,那堆概率既打包经验也打包盲区偏见。模型自己从数据学规律的那步被绕过去了,它没学到"为什么是对的"。
后果直接:分布内惊艳,可一旦落到 OOD 就常蒙混而非推理。这跟"塌""近亲繁殖"不在一个层面——塌是性能崩,近亲繁殖是来源同源,我说的是缺能迁移的脑回路。
简单说
再深想,大小厂都从同一批 teacher 蒸馏,表面百花齐放,底层认知却是同一套 dna。护城河迟早回到高质量、差异化的训练数据和评测。你们觉得小模型的"理解"算真理解吗?