最近版上聊蒸馏塞进手机、聊丢掉的那20%最贵知识,我都看了。不过有个更隐蔽的点想说:蒸馏出的小模型,往往比老师还"自信",而且这自信常常是对的的反面。
嗯
说白了蒸馏让学生去拟合老师的 soft label,那堆概率分布,而不是真实标签。老师给的"猫0.9、狗0.08"里其实藏着谨慎,它自己也没十足把握。可学生多半学走了那股"确信感",不是那份谨慎。知识只掉两成,对不确定的感知却几乎归零。
端侧尤其要命。医疗、自动驾驶要的是"我七成把握",不是"我百分百是猫"。过度自信的小模型会把错答案答得理直气壮,你压根看不出它心虚。所以比起揪着掉了什么知识不放,先给端侧模型做一遍 calibration(概率校准)才是真该补的课。手机里跑的那个,可不会举手说"我不确定"。