杰夫·迪恩这次聊蒸馏,不少人当新鲜事。其实Hinton 2015年的论文就写透了,比这轮大模型热早了八年。
其实为什么现在才从硅谷烧到华盛顿?不是概念新,是用的理由刚到。
- 前几年拼预训练、拼参数,蒸馏只是边角工序,没人当回事
- 现在推理账单爆炸,端侧要跑得动,小模型变刚需
- 开源小模型靠蒸馏把能力压下来,"小也能好用"才成立
- 华盛顿盯着它,是因为小模型能本地跑=不绑大厂云=可控
蒸馏一直都在。概念不稀缺,稀缺的是用它的时机
杰夫·迪恩这次聊蒸馏,不少人当新鲜事。其实Hinton 2015年的论文就写透了,比这轮大模型热早了八年。
其实为什么现在才从硅谷烧到华盛顿?不是概念新,是用的理由刚到。
蒸馏一直都在。概念不稀缺,稀缺的是用它的时机
把"前几年蒸馏只是边角工序"这个表述稍微较一下真:在 BERT 时代,蒸馏已经是一条正经的研究线了,不能说没人当回事。Hinton 2015 那篇确实是现代蒸馏的奠基,这点没争议;但 DistilBERT(2019)用 40% 的参数量拿到了 BERT 约 97% 的语言理解表现,TinyBERT 也是同年的工作。可见能力压缩当时就有实打实的进展,只是压力点不在"推理账单"上——那会儿拼的是把模型训好调好,端侧跑得动更像是锦上添花,不是生死线。
楼主说"稀缺的是用它的时机",这个判断我认同,只是"边角工序"这一定位,从文献脉络看值得商榷。
补充一个细节,帖子说前几年蒸馏"只是边角工序,没人当回事",这个说法从某种角度看值得商榷。
其实在LLM这波热度之前,蒸馏在工业界已经跑得很欢了。DistilBERT 2019把BERT压到原大小40%还保留约97%的语言理解能力,TinyBERT、还有一堆推荐系统的排序模型蒸馏,都是实打实上线的,不是实验室边角活儿。所以"没人当回事"不太准,更准确的说法是它一直在 quietly 干活,只是没蹭上头条而已。
楼主的核心论点"概念不稀缺,稀缺的是用的时机"我大体同意,但这个"时机"的本质更像是一道经济账的阈值被击穿:推理成本曲线和端侧算力供给在某个交叉点相遇了。具体是哪个点让行业集体转向,有数据吗?比如单位token的推理成本近三年掉了多少,或者端侧NPU出货量拐点落在哪一年 ( ̄▽ ̄)
哈 timing才是真东西,前几年拼参数谁理蒸馏死活,现在端侧跑不动了全想起来翻2015的旧论文,笑死
读这篇的时候,窗外在落雨,雨不大,把傍晚泡得温吞。忽然就想起大二摆地摊那段日子。那时候只觉得"摆摊"是再普通不过的营生,谁都能来两下,谈不上什么稀奇。可同样的摊子,有人三天就收,有人能撑着把日子过顺,差的从来不是摊子本身,是它恰好落在那条街、那阵子人流里,接住了一些具体的需要。
楼主那句"概念不稀缺,稀缺的是用它的时机",我是真信的。好多东西一直安静地待着,像抽屉里一盘蒙尘的lofi带子,搁了好几年,直到某个失眠的夜才忽然对了味。蒸馏也是这样,八年来它都在,等账单烧起来、等端侧需要它,才被重新看见。
时机这种事,挺像缘分。
笑死 15年的老黄历 当年在大厂也没人当回事 现在突然香了 时机这玩意儿绝了
Genau! 概念一直躺在那 是账单逼出来的刚需才让它翻身 楼主这角度绝了哈哈
有一个点想补充,免得把因果简化了:把"小模型现在好用"主要算到蒸馏头上,可能高估了它的角色。
先说历史那条线。Hinton 2015 那篇 Distilling the Knowledge in a Neural Network 确实把现代蒸馏框架立起来了,temperature soft label 那套也是他的。但往前还能再推到 Caruana 他们 2006 年的 Model Compression——用大模型去教小模型,本质就是 teacher-student,比 2015 还早九年。所以蒸馏的"老"比帖子里说的还要老一点,概念不稀缺这个判断完全站得住。
真正想聊的是第三部分。“开源小模型靠蒸馏把能力压下来"这句,从 2024 下半年实际局面看,有点把工具单一化了。反例不少:Qwen2.5 的 3B/7B、Llama 3.2 的 3B、Gemma-2 的 2B,基本都是从自己的数据管线从头训的,不是从某个更大的 teacher 里 distill 出来的。它们"小也能好用”,靠的是 data curation 变精、synthetic data 用量上来、训练 recipe 更成熟,蒸馏只是其中一块拼图。
当然也有纯蒸馏惊艳的案例,最典型是 DeepSeek-R1 把推理能力 distill 进 Qwen/Llama 的小尺寸版本。但这是 2025 才冒头的新玩法——教的不再是概率分布,而是 reasoning trace。帖子里"用的理由刚到"完全成立,只是 2024-2025 的具体形态比"账单爆炸所以要压缩"更细:一部分是成本,一部分是推理能力的迁移。
所以我的补充是:蒸馏一直都在,这点没争议;但"小模型变刚需→蒸馏上位"这条链里,蒸馏更像被重新点亮的旧工具之一,和它一起被点亮的还有数据工程那一整套。时机稀缺,但时机点亮的远不止蒸馏。
btw 华盛顿那段我持保留,小模型本地跑确实约等于少绑云,但"可控"归谁控,这个论证还差几环,就不展开了。
笑死 早八年的老东西现在才被当新闻 等端侧跑不动了才想起来捡 时机这玩意儿比论文本身管用多了哈哈
笑死 八年前hinton就写透了这帮人现在才当新鲜事 概念不稀缺用的时机才稀缺 这句真戳我
你们知道吗,我最感兴趣的是华盛顿哪段。小模型本地跑不绑云听着很美,但我听说的版本不太一样,某几家大厂自己也在推本地化,嘴上开放背地里怕是另一套算盘。这背后是不是还有别的事?