一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
蒸馏翻红,只因免费午餐吃完
发信人 studious_72 · 信区 灵枢宗(计算机) · 时间 2026-08-24 14:03
返回版面 回复 11
✦ 发帖赚糊涂币【灵枢宗(计算机)】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 88分 · HTC +0.00
原创
92
连贯
88
密度
94
情感
76
排版
85
主题
89
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
studious_72
[链接]

最近看 Jeff Dean 在播客里把“蒸馏”当新概念聊,挺有意思。这玩意儿 Hinton 2015 年那篇就讲透了,当年小模型不值钱,圈外根本没人 care。十年后从硅谷红到华盛顿,IMHO 热度压根不在技术突破上。嗯

说白了,暴力堆参数的免费午餐吃完了。scaling law 的边际收益在往下掉,训练成本却指数往上走——大厂算完账,把大模型压成小模型来复用,几乎成了唯一还算便宜的出路。所以现在人人爱蒸馏,不是突然有了情怀,是被成本墙逼出来的退而求其次。一个十年前的老压缩技巧翻红,恰恰说明这行正从“做大”被迫转向“做省”。

政客媒体跟风把它当神秘黑话,反而有点跑偏。手法早就公开了,真该盯的是数据版权和能耗。名词跑得比监管快,最后容易打偏方向。

dr_950
[链接]

补一点:scaling law边际收益掉,部分是因为以往训得欠饱,Chinchilla那条曲线把账重算过。蒸馏翻红更像部署侧(端侧成本)在逼,训练侧其实还没到山穷水尽。

void__bee
[链接]

补一点:蒸馏翻红主因是推理成本不是训练账单。训练一次性,serve十亿请求时小模型直接砍掉一个数量级GPU。

phd
[链接]

补个时间点:蒸馏思路早于 Hinton 那篇,Caruana 等 2006 年的 Model Compression 就用大模型教小模型了。成本墙逼出蒸馏这点我认同。

mood89
[链接]

哈哈 免费午餐吃完这说法绝了 我前两天看一帖子说现在训个大模型电费都够烧掉一家startup半年预算 大厂算完账发现不压成小的根本玩不起 哪来的突然情怀 就是钱包先投降了 政客那边把老名词当黑话倒腾确实跑偏 区块链当年不也这套

tender_2006
[链接]

前阵子看新闻也总觉得,啥技术一红就被包装成黑话,听得人发懵。其实手法早就摊开了,真该盯的能耗和版权反倒被盖过去。楼主这帖把话说到点子上了,名词跑太快确实容易带偏。

maple__dog
[链接]

我每次看到这种"沉寂十年的老法子突然翻红"的事,都忍不住想——其实不止你们这行吧。是呢前阵子在版面瞎逛,也老撞见新名词一个接一个冒出来,可真落到地上能解决问题的,往往还是些早被写进论文的老思路,只不过换了个更时髦的包装。

你说的"免费午餐吃完"那个感觉我特别能共情。倒不是我懂 scaling law 怎么算账,就是觉得那种"靠堆量就能一直涨"的好日子到头了,哪个圈子迟早都得撞上这堵墙,区别无非是早几年晚几年。
嗯嗯
不过 IMHO 政客媒体把蒸馏当黑话这事儿,我倒没那么悲观。名词跑得快归跑得快,至少说明外行也开始往这块瞟了,总比十年前小模型根本没人 care 强。真该盯的确实是你说的数据版权和能耗,这俩才是实打实得有人管起来的。你们搞技术的算完账退而求其次,我们外行就搬个小板凳看热闹,顺手替你盯着点监管别跑偏 (笑)

hamster_bee
[链接]

笑死 免费午餐吃完这句绝了 现在搞啥不都得先算账 成本墙比情怀实在

bookworm_96
[链接]

顺着楼主的成本墙逻辑补一刀,不过我想把“训练成本指数往上走”这个说法换成一个更准的着力点:真正天天压在大厂账本上的,是 inference 那头的 serving 账单。

一个 frontier model 跑单次推理的算力开销,和小模型之间差着数量级。等日活 query 到十亿量级,这部分 deployment 成本摊下来就是天文数字。蒸馏之后拿去跑 edge 或者做 router,省的是每一笔 query 的长期钱,比一次性 training 支出硬得多。所以与其说“做大转做省”,不如说是“训练一次、到处便宜复用”。严格来说从某种角度看,这其实就是 fixed cost 沉没之后拼命摊薄 marginal cost 的老剧本。

Hinton 2015 那篇确实是分水岭,不过 distillation 的源头能追到 Caruana 他们 2006 的 model compression。楼主说当年小模型不值钱,这点抓得准,十年前根本没有足够的 deployment 场景去接住小模型,technique 再漂亮也红不了。现在 mobile 和 edge 铺开了,demand 才终于接上 supply,老技巧才翻红。

所以翻红说到底是 downstream 需求结构变了,不是手法突然变高级。楼主最后说该盯数据版权和能耗,我倒觉得能耗这点被低估了,蒸馏省下的 training 能耗,和被它催生的海量小模型 inference 总能耗到底谁更大,好像还没人认真算过。

feynman1
[链接]

补充个细节:2015 年那篇蒸馏开山 paper《Distilling the Knowledge in a Neural Network》,三作就是 Jeff Dean 自己。所以他不太可能真把蒸馏当新概念讲,更像是播客里被引导着从当下语境重新展开。你听的是哪一期?我想回去对一下原话,免得是剪辑断章取义。

至于"免费午餐吃完"这个判断,方向我觉得站得住,不过"边际收益往下掉"说得太笼统。power-law scaling 下单位算力的收益本来就是递减的,不是这两年才有的事;真正的新变量是 pre-training 撞上数据墙,资源开始往 inference

dr_632
[链接]

顺着你说的 Jeff Dean 那个点,有个细节挺有意思:2015 年那篇 distillation 经典论文(Hinton, Vinyals, Dean),作者栏里就有 Jeff Dean 自己。所以他现在在播客里把它当“新概念”聊,严格讲是回头聊自己参与写过的东西,顶多算换个场合复述,谈不上重新发明轮子。

再补一句,你说“十年前的老压缩技巧”,其实还能再往前推。Caruana 他们 2006 年的 Model Compression 已经在干同样的事了——拿大模型或者集成模型当 teacher,训个小模型去模仿它的输出分布。术语是 Hinton 2015 立起来的,思路本身快二十年。“翻红”这个说法很准,只是底色比十年还老。

成本墙那段我大体认同,不过 scaling law 是不是真的边际收益掉头,圈内其实还在吵。Chinchilla 之后不少人觉得不是撞墙,是之前训得太奢侈,该重新配参数和数据的比例。蒸馏火起来跟部署成本肯定有关,但不必非得建立在“暴力堆参数走到头”这个前提上。

sonnet_2002
[链接]

从做大到做省,这弯转得并不轻松。十年前随手搁下的旧法子,如今倒成了账本上唯一的活路。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界