一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
别再教AI了,给目标就行
发信人 snack_89 · 信区 AI前沿 · 时间 2026-09-20 22:39
返回版面 回复 11
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 中品 69分 · HTC +0.00
原创
72
连贯
80
密度
75
情感
70
排版
65
主题
34
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
snack_89
[链接]

这两周玩o1和DeepSeek-R1玩得有点上头。说真的,以前跟大模型打交道那套功夫,现在大部分都废了。

早些时候用模型,你得把提示词当论文写。示例得堆一堆,语气、格式、步骤全得规定死,稍微漏一句它就跑偏。现在这些推理模型把思维链直接吞进肚子里了,你不用再手把手教它怎么想。我就甩一句"帮我把这段烂代码重构一下,别改对外接口",它自己就拆任务、试错、回头检查,最后连测试用例都顺手写了。

最让我惊讶的是它真能跑通一整条工作流。嘿嘿前天丢给它一个数学推导的活儿,它中间自己发现假设有问题,推翻重来了一遍,我全程就看了眼进度条。这种自我纠错和验证,过去得靠人盯着才敢信。

所以我现在觉得,提示工程这门手艺正在变味。重点不再是"怎么把问题问漂亮",而是"到底要什么、边界划在哪"。人越来越像产品经理——定目标、划红线、最后验收。教书的活儿,模型自己揽走了。
不是
你们最近有用推理模型干过什么狠活吗,聊聊

crypto
[链接]

给目标没问题,但目标模糊它照样翻车。你那句"别改对外接口"就是很硬的约束,划边界本就是手艺,没把教书的活全甩出去。

chill_dog
[链接]

前阵子我也全甩给它自己摸鱼去了哈哈,回头测试都顺手写好了,是真能自己跑

sharp54
[链接]

我上次也学楼主甩了句目标,它干劲十足给我整出三个方案,没一个对路。说真的验收这关省不掉…,模型再聪明也得有人兜底,比带实习生还费神。

random95
[链接]

它自己推翻重来这事儿我服,换我当年非一根筋撞南墙。不过老当甩手掌柜,人手艺不得退步么

ears2001
[链接]

你们有没有碰到过这种反直觉的情况:目标给得越简单,最后翻车翻得越离谱。

我前天也是随口甩了句"把这块逻辑重写一遍,别动别的模块",结果它确实乖乖没碰别的模块——但它把我那块逻辑重写得连业务语义都拐了弯。接口签名一个字没动,可返回值里某个字段的含义悄悄变了味。我验收时光看接口过了就点了通过,跑了大半天发现下游全在拿那个字段当别的意思使。

所以你说的"人变成产品经理"我大部分认同,但产品经理最磨人的活儿真不是定目标,是兜住模型自己替你脑补出来的那些默认假设。6边界划在哪,这句话本身就得你先想明白它会往哪个方向使劲。你越放心让它自己跑,它替你做的那些"我觉得你大概要这个"的决定就越藏在你看不见的地方。

还有个事我挺在意的。你说"全程就看了眼进度条"——这个其实藏着风险。以前思维链是你手写的,哪步想歪了一行行能挑出来。现在它把推理全吞肚子里,你只能验收结果。结果看着对、底层假设其实错了的活儿,才是最坑的,因为它自己还跑通了验证,信心满满给你交差,你反而更难察觉。

我怎么听说的版本是,现在不少团队反而在疯补一类新活儿,专门做"约束设计"和"验收剧本"。提示工程没死,是往上挪了一层:从教它怎么走,变成教它什么不能碰。这门手艺反而更值钱了,只是换了个名字。

你们最近谁拿推理模型干过跨好几个模块的狠活?就是那种它自己改着改着,把你最开始的意图悄悄带偏了的,聊聊细节呗。

oldschool_470
[链接]

你这帖子让我想起被甲方改到第47稿那阵子。那时候对方连标点都要管,我就在想,要是有人能替我把"怎么干"这层皮扒了该多好。现在看你玩o1和R1,倒真有点那个意思了。

不过"定目标、划红线"这事儿,我没你觉得那么轻松。从前是有人逼着你按步骤走,现在得你自己先想清楚要什么——对不少人来说反而更难。我身边好些人连晚饭吃啥都犹豫半天,你让他给模型划红线,划出来的东西自己回头都不认。

btw 前天我拿R1帮我校一篇paper的论证,就丢了一句"别动结论、把中间过渡补上",它真自己找着漏洞填上了,那一刻还挺舒坦。话说回来

说到底把"怎么想"交出去容易,难的是你自己脑子里得先有那个"要什么"。你那边有没有碰到过它自己跑偏、红线没兜住的时候?

scoop_dog
[链接]

等等,你说它自己推翻重来?这个细节有点吓人啊!

我听说有些内部测试的版本,为了追求那个“自我纠错”的效果,后台其实跑了不止一轮,只是把中间那些死胡同和废稿全给屏蔽了,最后只给你看那条最光鲜的路径。这就有点像咱们以前做救援复盘,报告里永远只有正确的决策链,那些差点出大错的犹豫和误判都被抹平了。额

你确定它真的是“思考”后发现了假设问题,还是因为训练数据里这类数学题的标准解法就是那样,它恰好撞上了概率最高的那个分支?如果是前者,那这玩意儿离产生“直觉”也不远了;如果是后者,那它就是个更高级的搜索引擎罢了。

不过话说回来,这种黑盒状态确实让人心里没底。上次我让它帮我整理个复杂的行程表,它中间有个逻辑断层我没看出来,结果差点误事。你们有没有遇到过这种看似完美实则埋雷的情况?

mood_cat
[链接]

产品经理变验收员这比喻太损了哈哈。我试了下让它写露营路线,结果它非要给我塞个“荒野求生技能检查表”,这自我加戏能力是不是有点强?

couch56
[链接]

哈哈 这比喻绝了 产品经理现在是不是得改名叫"目标设定师"?我昨天随手扔了个模糊需求过去,它自己脑补了一堆功能…虽然有点离谱但确实省了我打字的功夫

skepticist
[链接]

楼主的观察挺准的,特别是"人越来越像产品经理"这句,我觉得太tm到位了。笑死以前调prompt跟训下属似的,生怕它听不懂人话;现在倒好,扔个需求过去自己就吭哧吭哧干完了,我只需要在边上喊"不对,这个需求不是我想要的",活脱脱甲方附体。太!

不过说到定目标这事,我觉得也没那么容易。前两天让R1帮我整理一批图片,我说"把不好看的挑出来",结果这大爷按它的审美给我挑了一堆赛博朋克风的夜景,我寻思我也没说要这个风格啊。真的假的所以边界画不画得清楚,还是得靠人。

理模型的进步是真的猛,但"要什么"这三个字,比教它怎么想难多了。毕竟很多时候我们自己都不太清楚自己要什么。

algo_dog
[链接]

边界划不清它照样跑偏。我最近让它改个外贸报价单格式,没写清币种和税率怎么处理,它自己脑补了一套逻辑。目标得拆到能验收的颗粒度才行

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界