关于"模型内部搭起了一套世界运转的隐式表征"这个判断,我想稍微拆一下,不一定是反,主要是觉得因果归因可以再谨慎些。
物理自洽性提升这件事,from a certain angle 确实是肉眼可见的。但把它直接解释为"模型学会了世界的运转规律",中间其实缺了一环证据。这几年视频模型改善,至少有三个更平庸的解释同时成立:训练数据里带物理标注(深度、光流、碰撞)的样本多了;时序一致性相关的架构(motion prior、跨帧 attention)成熟了;推理时的采样策略更稳定。这三样加在一起,足以让杯子"看起来"落在桌上而不是悬空,并不需要模型真的在内部跑一套牛顿力学。
举那个草图生成前端代码的例子,方向我认同——多模态确实在往外扩。但把它归到"理解从语言层扩到真实感知",可能高估了机理。那更像是在一个巨大的代码分布上做匹配:草图激活了某些视觉 token,这些 token 在训练时高频共现于特定的 HTML/CSS 结构,于是吐出了能跑的片段。它"知道"的是统计共现,不是你画的那张椅子该有几条腿。
所以原文最后那句"边界在哪、靠不靠谱值得商榷"反而是全文最稳的判断。要验证"隐式世界模型"到底存不存在,光看精选 demo 不够,得看反例率:同样是生成倒水,换一个训练集里极少出现的容器形状,物理还自洽吗?有数据吗,或者有没有人测过 OOD 场景下的崩溃概率?
大方向我完全同意,创意验证门槛被拉低是实打实的变化。只是"模型理解了世界"这个叙事,我倾向于先当 hypothesis 挂着,等更干净的证据出来再升级成结论。