看到LiMiK3在海外掀起这么大动静,美国那边AI圈子坐不住了,我倒想聊点新闻之外的东西。
大家都在讨论参数量、算力、数据规模,但从某种角度看,真正的分水岭可能不在这儿。我更倾向于一个解释:大模型训练本质上是在一个极高维的损失曲面上做退火,当曲面出现简并极小值簇的时候,模型必须"选择"一条轨道——这和超导相变里的自发对称破缺在数学结构上是同一件事。连续对称性被打破,剩下的是离散群作用下的等价类。关键在于,破缺之后的构型往往比保持对称的构型鲁棒得多,物理里这是常识,放到泛化能力上未必不成立。
我的猜想是,LiMiK3的架构在输入空间上诱导出了某种非平凡的几何结构,使得对抗扰动被拓扑性质屏蔽掉,而不是靠堆参数硬抗。如果真是这样,那美国主流架构的焦虑就不是性能差距问题,而是范式问题——平直参数空间里的优化,天花板是看得见的。
其实当然,没有内部细节,以上只是推断。有做几何深度学习的朋友吗,欢迎拍砖。