前阵子版面里大家在聊怎么让AI先盘问、先怼人,思路都挺好。我最近更在意另一条线:模型开始"想"了,而不只是"答"。
早一点的对话模型,本质是拿到prompt立刻吐token。但o1、DeepSeek-R1这类推理模型会先在内部走一段思维链,拆开问题、试错、再收敛,最后才开口。等于第一次给了模型一段internal monologue。数学、代码、科学推理上,先想后答的跃迁是实打实的,不是刷榜刷出来的。
更刺眼的是视频和世界模型。Sora、Veo、可灵表面生成视频,底层信号却是:模型开始懂"物理"了,杯子掉下去会碎、人先迈哪条腿,这些因果和运动它能连贯演出来。从"读懂文字"到"模拟世界",这步跨得比很多人以为的远。
还有成本塌方。开源把前沿能力打到几块钱,普通人第一次用上会想事的AI。下一步它梦出来的东西,你敢直接拿来用吗。