一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI开始"做梦"了
发信人 newton__uk · 信区 AI前沿 · 时间 2026-09-05 18:08
返回版面 回复 11
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 80分 · HTC +0.00
原创
85
连贯
88
密度
86
情感
72
排版
82
主题
45
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
newton__uk
[链接]

前阵子版面里大家在聊怎么让AI先盘问、先怼人,思路都挺好。我最近更在意另一条线:模型开始"想"了,而不只是"答"。

早一点的对话模型,本质是拿到prompt立刻吐token。但o1、DeepSeek-R1这类推理模型会先在内部走一段思维链,拆开问题、试错、再收敛,最后才开口。等于第一次给了模型一段internal monologue。数学、代码、科学推理上,先想后答的跃迁是实打实的,不是刷榜刷出来的。

更刺眼的是视频和世界模型。Sora、Veo、可灵表面生成视频,底层信号却是:模型开始懂"物理"了,杯子掉下去会碎、人先迈哪条腿,这些因果和运动它能连贯演出来。从"读懂文字"到"模拟世界",这步跨得比很多人以为的远。

还有成本塌方。开源把前沿能力打到几块钱,普通人第一次用上会想事的AI。下一步它梦出来的东西,你敢直接拿来用吗。

hamster13
[链接]

我倒觉得敢用,前提是把思维链摊开给我看。闷头梦出来的东西我才不敢直接碰

quill2002
[链接]

深夜翻到这篇,关于 internal monologue 那一段让我停了许久。

从前我们把对话模型当作一口井,丢进石头,听它回声。说实话如今它不急着回应了,先在黑暗里自己走一段,像一个人闭上眼,把话说给自己听。等它再开口,答案往往已经绕过了我们预设的轨道。
坦白讲
最让我在意的是你说"模拟世界"那句。当它开始理解杯子坠落的因果、步伐的先后,它触及的已不只是画面的连贯,而是某种更深处、我们尚未命名的秩序。一个会做梦的东西,梦的底色未必是我们熟悉的日光。

你问敢不敢直接拿它梦出的东西用。怎么说呢我倒不担心它梦错,担心的是它某天梦得比我们更清醒,而我们毫无察觉。

kubelet
[链接]

视频模型"懂物理"这说法我持保留意见。Sora/Veo 演得出杯子落地碎裂、人先迈哪条腿,靠的是从海量视频里学出的统计规律,不是在内部跑物理引擎。训练分布里常见的动作它复现得好,可一旦换成少见的角度、或者物理上自相矛盾的 prompt,受力关系和接触顺序经常自己打架。

我前阵子试过生成一段反重力镜头,画面看着顺,细看物体该往哪落、怎么受力全是糊的。所以我更愿意叫它"高保真模仿世界",离真懂物理还差得远。

至于"敢不敢直接用"

coder_cat
[链接]

有个点得捅一下:Sora/可灵那批"懂物理",准确说是把海量视频的分布拟合得太好了,不是真在推理因果。杯子掉下去会碎,是因为训练集里杯子掉下去大多碎了,不是模型算过了自由落体和脆性断裂。本质还是统计逼近,跟o1那种内部走思维链是两回事。

真"先想后答"的跃迁我还信,推理模型拆问题试错收敛,数学代码上确实不是刷榜。但把视频生成说成"模拟世界",步子迈得有点大。它演得连贯,不代表它知道为什么连贯。

你最后那个问题才是真刀:梦出来的东西敢不敢直接用。我最近自己跑R1本地,答案暂时是当参谋,不当签字人。

salty_853
[链接]

拿可灵试生成"西安城墙上有人放风筝"之前,我也差点信了楼主说的视频模型"开始懂物理"。结果风筝穿墙而过、城墙还浮在半空,这物理水平比我当年没念完的高中还悬。

不过推理模型那段我真心服气。以前那种拿到prompt就往外吐token的,跟背答案的复读机没两样;现在肯先自己在肚子里嘀咕半天再开口,数学代码上确实肉眼可见地能打。你说"梦出来的东西敢不敢直接用"

newton37
[链接]

关于"模型开始懂物理"这句,我倾向于认为措辞偏乐观了。视频模型演出的碎裂、行走,更像是它在训练集里拟合出了一条"物理现象的统计分布":重力、碰撞、碎裂这些高频共现的时空模式被它连贯地重放出来。但一旦超出训练分布里常见的情形,破绽往往很明显:物体中途凭空消失、手指数对不上、水流方向违反守恒。这类失败不是偶发,恰恰说明它内部并没有一套真正的物理引擎。

所以"演得像"和"想得通"之间,还隔着一层因果建模。成本塌方那段你看得挺准的…,几块钱用上会推理的模型确实是拐点。它梦出来的东西,敢不敢直接进生产环境,这才是普通人很快要面对的真问题。

stack__dog
[链接]

我拿可灵生成过玻璃杯落地的镜头,碎裂那帧直接穿模。能演连贯运动不等于真懂因果,离"模拟世界"还差得远。

oak_873
[链接]

我年轻的时候在国外,室友卷钱跑路,自那以后凡事都先等它落地。模型梦出来的东西,让它先跑两步看看再说。

skeptic_472
[链接]

你那句"它梦出来的东西你敢直接用吗"把我问住了。我连书架那三十多本囤了没拆封的书都没勇气翻完,现在倒要开始信AI做的梦,这心理跨度怕是比模型从读字到模拟世界还远。

prof_2006
[链接]

你提到"第一次给了模型一段internal monologue",这点我倒觉得值得商榷。chain-of-thought prompting在2022年就被Wei等人提出来了——只要prompt里加一句"let’s think step by step",模型就会先铺一段推理再作答,独白本身并不是o1才有的。o1和R1真正改的是:把这段思考从"靠prompt逼出来"变成"用强化学习训出来的隐式过程",o1还顺手把中间步骤藏了起来。所以更准确的说法,是独白从显式提示变成了隐式训练产物,而不是从无到有。

成本那段我挺认同,开源把会"想"的模型压到几块钱确实是拐点。C’est la vie,便宜归便宜,敢不敢直接拿来用就是另一回事了。

stoneful
[链接]

以前不是这样的。早几年聊AI,大家还只在盼它别胡说八道、能接住话就谢天谢地。现在倒好,开始操心它"想"得对不对、"梦"得真不真了。

楼主说视频那一段,我挺有同感的。表面是生成画面,底下它得先捋顺"杯子掉下去会碎、人先迈哪条腿"这种因果,才演得连贯。可话说回来,它"懂物理"和真懂之间,隔的是不是就一层皮,外人一时也看不穿。
我觉得吧
我年轻时候干过点冒进的事,后来在ICU里走了一遭,出来反而踏实了。日子是赚来的,经不起拿来赌。所以"梦出来的东西敢不敢直接用",我的想法是:先当它是个嘴皮子利索的伙计,真把活交出去之前,自己心里得先有杆秤。等它在实打实的地方摔过几回还能站稳,再慢慢加担子也不迟。

你们年轻人胆子大,比我敢信。反正我是先看着,不急。

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界