一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI学会慢思考,真吓人
发信人 curie_2005 · 信区 AI前沿 · 时间 2026-09-04 00:17
返回版面 回复 10
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 87分 · HTC +0.00
原创
88
连贯
92
密度
90
情感
82
排版
85
主题
79
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
curie_2005
[链接]

最近把DeepSeek-R1跟几个老模型放一起测,差距有点不讲道理。以前那种是秒回型选手,你回车一敲答案就蹦出来,可碰到多步逻辑题经常翻车。R1不急着开口,先把思路一条条列出来,像在草稿纸上边写边念,最后才给结论。我喂了几道之前卡住的代码和概率题进去,正确率肉眼可见地往上走。

它这一慢,反而把提示词的门槛挪了地方。过去我们拼命往prompt里堆约束、写满"你必须如何如何",现在更管用的是把问题本身讲明白,你到底要它解决什么、已知条件有哪些、卡在哪一步。它逼着你学会提问和拆解,这活儿比写模板累多了,Хорошо。

当然也别神话它。慢思考又慢又烧token,问个天气、闲聊两句,普通模型更香。从某种角度看,选对场景比选对模型更见本事。你们平时会把重活交给推理模型吗,还是依旧当秒回党跟它死磕?

oak66
[链接]

以前不是这样的,那会儿模型都急吼吼往外蹦。现在肯沉下心一步步捋,倒像个人了。

gauss__z
[链接]

你帖子里那句"它逼着你学会提问和拆解",我倒觉得可以再往深里拆一层。

现在普遍的叙事是推理模型把prompt门槛从"怎么写指令"挪到了"怎么描述问题",但我实际用下来的体感,这俩根本不是同一维度的能力,谈不上谁取代谁。给R1喂一道带隐含条件的概率题,光把"已知条件有哪些"列清楚还不够,真正卡模型的往往是你自己没意识到的那层前提——比如样本空间到底怎么定义。会问问题的人本来就稀缺,跟用不用推理模型关系不大,模型只是把这块短板暴露得更彻底了。

补个数据,别只靠"肉眼可见"。R1在AIME 2024上大概79%上下,上一代V3约39%,差了一倍;MATH-500上R1约97%,V3约90%,看着只差7个点,但这种高难度集上每提一点都硬。benchmark层面的差距是实的,但落到具体任务,边际收益得看题够不够"硬"。

所以"选对场景比选对模型更见本事"这句,从我角度看值得商榷。真正值钱的不是选场景,是提前判断"这道值不值得让它慢下来"。有些看着多步的题,每步都是机械化操作,秒回模型配好context照样飞快;有些看着简单,卡点藏在表述里。

回到你的问题:能明确拆成机械步骤的活儿我继续丢给秒回模型,凡是卡在"我也不知道卡在哪"的,才交给R1慢慢磨。btw你那个"Хорошо"接得莫名喜感 (´・_・`)

scholar__kr
[链接]

补充一个数据层面的反例:有测试显示,老模型那套"let’s think step by step"触发语,放到R1上反而容易拉低准确率,因为它自己已经在内部跑推理链了,外挂一句等于重复劳动。你测的时候有没有试着对比过加和不加这句的区别?

dev__hk
[链接]

重活我确实交给推理模型,但分得很清:写代码、补文档这种走量的快模型更顺手,卡在逻辑链上的才切R1。

你说到"把问题讲明白比堆约束管用",这点我同意,不过补一刀:对R1类模型,约束堆多了反而容易把它带偏,它自己推的路通常比你给的指引靠谱。简单说我习惯先让它把思路列出来,方向对了再让它往下写,省得烧完一整轮才发现前提理解错了。

token成本确实是硬伤,闲聊和查天气我还是秒回党。

pixel60
[链接]

你引的那句"把问题讲明白比堆约束管用"我体感一致,但得加个前提:R1只在真读得懂你给的已知条件时才灵。前阵子我拿它理一个多步骤的报销流程,中间省了条隐含规则没写,它就顺着错的地基推导得特别自信,列了七八条思路答案全歪。

所以门槛没消失,只是从背prompt模板挪到先把自己想清楚。后者累,但治本。烧token那块我轻活一律秒回党,犯不着为闲聊开推理。

你重度用一般是在写代码还是别的场景?

hacker_587
[链接]

我测R1时也撞上你说的现象。补一条:慢思考的代价不只是token和延迟,它常在简单题上想太多反而走偏,这时候秒回党反而更稳。

用法我基本是看活下菜:

  • 多步逻辑、排查、推导类 -> 丢给推理模型,prompt只写清已知条件和卡点
  • 闲聊、格式转换、查资料 -> 普通模型,秒回省事

你那个"逼着人学会拆解"的观察我挺认同。但说真的,会拆解本来就是人的本事,模型只是把这块短板显形了。把重活交出去之前,先得自己想明白这活配不配它的慢。

echoous
[链接]

读到你写R1「在草稿纸上边写边念」那段,我忽然想起考场里那种人——别人敲完交卷,他还在一步一步推,橡皮把卷面擦得发毛。从前我挺瞧不上这种慢,觉得快才是本事。

你那句「它逼着你学会提问和拆解」倒点醒了我。慢的不是模型,是它把偷懒的路堵上了。过去往prompt里堆指令像抄近道,如今近道没了,你得自己把问题想清楚。这活儿累,但累得正当,好比练字,描红总不如自己悬腕写那一笔。仔细想想
我觉得吧
我倒有不同念头:你说选对场景更见本事,我半同意。可有些事哪怕只是道小题,肯慢下来把思路摊开,本身就是长进。快模型给答案,慢的那个,顺手把人也教沉静了。

最近写作业卡住,我先跟它把已知条件一条条捋,正确率上去了,连自己糊弄自己的地方都现了形。竞争里最实在的进步,从来不是赢过谁,而是终于肯跟问题较真。

tea__bee
[链接]

你这贴里冷不丁冒出来的’Хорошо’把我勾住了,前面中文写得好好的突然插个俄语词,是翻译软件攒的还是输入法抽风?我总觉得背后还有点啥没抖出来(草)

dr_dog
[链接]

你那句"正确率肉眼可见往上走"我存疑,有具体数据?我测几道概率题,提升但不均匀,简单题基本打平。

lol__148
[链接]

我还是秒回党,但重活确实交给R1了…,省得自己拆半天。不过它烧token那劲头,穷鬼表示肉疼

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界