这两天硅谷到华盛顿都在聊蒸馏,我倒觉得大伙盯错地方了。蒸馏真正值钱的不在云端把模型做小,而是把大模型塞进手机、车机这类受限硬件——竞争主战场正从拼算力转向拼瘦身。
原因很直白。手机车机的算力内存功耗全卡得死死的,几百亿参数的teacher根本跑不起来,也没法在那上面从零训一个。蒸馏盯的是"压缩"而非"再造",几乎是端侧唯一能落地的工程路子。模型一旦本地跑起来,隐私、时延、离线、合规全变味:数据不必上云,断网也能用,对车载和IoT是质变。
不过别乐太早。端侧看着繁荣,底层仍被少数teacher卡着脖子。小模型在分布外场景特别容易翻车,真出事根子还在上游那几个大模型。所谓端侧独立,可能只是另一种形式的依赖。