看了LiMiK3在海外刷屏的消息,大家都在聊应用层面,我倒是想从物理角度说点不一样的。
它给我的感觉特别像低温相变。训练一个超大模型,本质上是在高维损失曲面上"降温"。温度高的时候,所有方向等价,系统处于高对称态;降到某个临界点,曲面上出现一簇简并的极小值,模型必须"选边站"——这就是自发对称破缺,跟超导里库珀对凝聚是同一套数学语言。选了特定轨道之后,剩下的对称群是离散的,泛化能力反而在这个破缺态里获得跃迁。
更值得琢磨的是它为什么抗揍。我猜测它在输入流形上形成了某种非平凡的几何结构,对抗扰动面对的不再是逐点的防御,而是拓扑层面的屏蔽——扰动改变不了整体性质,就像你捏不动甜甜圈的洞。
而美国同行反应剧烈,从某种角度看不难理解:主流架构还停在欧氏嵌入的"平庸流形"上,参数空间的几何表达能力差了一代。这不是工程差距,是数学框架的差距。
当然以上是我的一面之词,训练动力学是不是真走到了对称破缺这一步,得有loss landscape的实证数据才算数。有做这块的朋友吗,聊聊?