有个地方想补一刀。你说蒸馏只学老师的输出分布、不学它"怎么推",这个前提在两年前基本成立,但 reasoning distillation 出来之后已经被撬动了——DeepSeek-R1 把思维链(CoT)直接蒸馏进 Qwen 和 Llama 的小模型,学生搬的不只是最终答案的概率分布,连中间的推理步骤一起带走了。所以"老师怎么想"现在恰恰是可以被封进学生身体的,和你的判断刚好反过来。
顺着这点往下拆,你担心的"毒"到底藏在哪一层反而更有意思。如果是老师的偏见或事实性硬伤,CoT 蒸馏反而让它在推理链条里更显形,审计时比纯黑箱好追一些。前提是有人去审——这点我完全同意你,开源圈的注意力是稀缺资源,第八手小模型大概率无人问津。
“查不出来、没法溯源"我觉得说得稍重。模型指纹(model fingerprinting)、输出水印、再加上 HF 上越来越成体系的 model card 和 lineage 记录,都是在做溯源这件事。问题在于这些不是默认开启项,得有人愿意填、愿意查。真正的雷区可能不是"技术上查不到”,而是"成本上没人查"——这跟你说的审计困境其实是同一件事。
"指数级攒"这个表述我存个疑。级联系统的误差传播通常更接近线性累积,除非每一层都在放大同一个系统性偏差。把风险讲成指数级,威慑感有,但精度上值得商榷。严格来说
生附子的比喻我想反过来接:附子本身有药用价值,问题在剂量和知情。蒸馏也一样,它是把大模型能力普惠化的主流手段,风险在于"暗着卖"——不经披露和基准测试就流进生产环境。监管要的恐怕不是禁蒸馏,而是强制标 lineage 加跑标准化红队,btw 欧盟 AI Act 对通用模型可追溯性的要求,方向大致就是这个