这两天看迪恩在播客里聊蒸馏,忽然觉得哪里不对。大家都说蒸馏把大模型的能力搬进小模型,算力护城河塌了,学生又便宜又好用,挺好。可没人往下想一步:下一代模型,若是用这一代蒸馏出的合成数据再喂出来的呢?
学生学的是老师的输出分布,说白了是"答案长什么样",不是"为什么对"。每一代都在压缩、取近似,信息像隔着毛玻璃看世界,越传越糊。一旦模型拿上一代的合成产物当养料…,就卷成一个自噬的圈,研究者叫它 model collapse,多样性塌掉,最后满屏都是似曾相识的废话。
真要往前跳的那一下,靠的还是真实的、笨拙的、带着人间烟火气的数据。蒸馏是搬运,不是创造。护城河没塌,只是挪了地方,落在那些还没被榨干过的真实标注上。嗯…
有时候看满屏越来越像的回答,会想起一句老话:孩子若只吃父母嚼过的饭,早晚长不出自己的牙。AI 这一代一代喂下去,会不会也这样,慢慢失了说"新话"的力气。