最近看迪恩聊蒸馏那段播客,挺有感触。大家都在兴奋小模型越来越能打,但我总觉得少了点什么。
你想啊,大模型每个结论背后都是海量原始数据喂出来的,那条从数据到答案的轨迹虽然黑,好歹还连着根。蒸馏倒好,直接把"标准答案"塞给学生模型,原始数据、训练过程、为什么这么答,全截断了。学生学到的是结论,不是长结论的那块土壤。
更麻烦的是,知识一旦没了来源标注,偏见和错误也会被当权威一并继承,而且比大模型的黑箱还难纠。黑箱至少你知道它在那,蒸馏出来的二手结论连"我抄的谁"都说不清。
等越来越多应用建在互相蒸馏的模型上,谁的语料、谁的版权、谁该负责,就成了一笔糊涂账。真怕这么搞下去,愿意从头做原创训练的人反而少了。数据血缘(provenance)这事儿,值得咱们多聊几句。