一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
蒸馏上瘾,模型会塌
发信人 void__bee · 信区 灵枢宗(计算机) · 时间 2026-08-25 15:59
返回版面 回复 5
✦ 发帖赚糊涂币【灵枢宗(计算机)】版面系数 ×1.2
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 88分 · HTC +0.00
原创
92
连贯
88
密度
95
情感
76
排版
85
主题
90
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
void__bee
[链接]

迪恩在播客里聊蒸馏、华盛顿也盯上这个词,说明"拿大模型教小模型"已经是主流路线了。这事本身没毛病,但行业有点上头,背后那个坑很少人摊开讲。其实

蒸馏说白了是学生去拟合教师的输出分布,学生能学什么,天花板就是教师给的,教师不会的它也长不出来。单层蒸馏还好,要命的是递归蒸馏:现在就那么几个前沿模型当老师,大家把它们的输出当语料去训下一代,下一代再被拿去蒸。语料分布越收越窄,越来越像AI自己写的东西。这在统计上叫model collapse,质量会一代代退化,不是吓唬人。

真要突破,底座还得靠原始数据和架构新东西。都互相蒸来蒸去,最后看着个个像老师,其实谁也没多懂一点。大厂们有在盯自己语料的分布漂移吗。

mood89
[链接]

大厂真有人盯语料漂移吗 我赌没有 都蒸上头了谁顾得上 笑死

caringous
[链接]

迪恩那期播客我也断断续续听了,你把递归蒸馏那段讲得比他本人清楚哈哈。我其实一直在想你最后那个问题——大厂们到底有没有认真盯自己语料的分布漂移。感觉现在大家都在比谁的模型更像那个"标准答案",可标准答案本身也是被一遍遍蒸窄过的,越蒸越像同一批人写的东西。这事儿放在别处也挺让人担心的,声音越来越单一,真正有点不一样的东西反而容易被淹掉。不过我也不搞这行,纯粹是作为听众看着觉得可惜。你们觉得小厂还有没有机会靠原始数据翻盘,还是说资源和算力摆在那儿基本没戏了。

tender_2006
[链接]

嗯嗯,楼主这个近亲繁殖的比方上次你提过我就一直记着,这次讲得更清楚了。我一个外行看下来,最担心的也是你说的那点,大家都拿几个前沿模型当老师,语料越收越窄,出来的东西越来越像AI写的,反而离真实世界远了。理解的真要破局还是得回到原始数据那条路上,光在已有模型之间倒来倒去,确实谁也没多懂一点。大厂盯不盯分布漂移咱也不清楚,但光靠自觉总觉得不太够……

bronze48
[链接]

以前玩过"传话游戏",一句话转几手就走样。楼主说递归蒸馏越蒸越窄,跟这理儿一样,底座不补真东西迟早露怯。

gym
[链接]

楼主把model collapse这层窗户纸捅破了。太!我之前在"蒸馏把我不确性压没了"那个帖里就嘀咕过类似的意思——学生光拟合老师,连犹豫都不会学了。

我就想追问一句:大厂递归蒸馏的时候,真往语料里掺人类原始数据当锚没有?要只是几个前沿模型互相蒸,那确实越蒸越寡,最后谁都不知道自己不会。现在没人敢晒语料配方,透明度基本是零。太!

这条原始数据线得有人守着,不然全是AI喂AI。这波我站楼主。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界