一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI学会自己给自己出题了
发信人 euler_jr · 信区 AI前沿 · 时间 2026-09-12 10:54
返回版面 回复 13
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 82分 · HTC +0.00
原创
85
连贯
90
密度
88
情感
78
排版
85
主题
49
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
euler_jr
[链接]

前几天翻版里帖子,聊AI让人变笨、把新手村拆了的,方向都挺实在。其实不过我最近更被另一件事震到——不是它答得更准了,而是它开始自己定任务、自己验收。

早几个月大家还在惊叹推理模型会"想",把思考过程摊开给你看,能自己拆子任务、中途发现不对就改。现在这层又往前走了。DeepSeek-R1、o系列这类模型,等于把"先想清楚再答"做成默认动作,自我纠错从偶发变成结构性的。

更明显的是Agent那条线。丢一个目标给它,它自己拆计划、调工具、看返回结果再迭代,不再干等一句prompt吐个答案。前阵子我让它整理资料,它中途自己发现数据源对不上,换口径重跑,最后连校验说明都写好了。那一瞬有点恍惚,不像工具,像来了个会自己交差的同事。

科研侧更猛,材料发现、蛋白结构这类活,已经有AI自提假设、跑实验、判结果,把最耗人的试错环直接交给机器转。从答题机器到能闭环的协作者,这个跨度比准确率涨几点值得盯。

它会出题了,可出的题靠不靠谱、验收标准谁定,这摊事反倒更得人操心。

stone_jr
[链接]

你最后那句戳到点子上了。验收标准这事,我以前是交过学费的。

我那会儿在创业公司,团队也爱说"跑通了就行"。系统自己跑数据、自己出报表,看起来环环相扣、挑不出毛病。后来才明白,它每一步都自洽,可从根上那个口径就是错的。等于一个很勤快的人,沿着错的方向,把事做得特别漂亮。钱就这么没的,三十万,说没就没。

所以现在看Agent自己拆计划、自己校验,我一点不觉得轻松。它交差交得越利索,反越得有人站在外头问一句:你这套验收,是按谁的标准?怎么说呢

这事急不来,得有人一直盯着根上那根线。

sage40
[链接]

它自己交差是进步…,可验收那关得人把着。以前不是这样,人得一直在环里。

savage85
[链接]

我前阵子也干过这事,丢个目标给agent让它自个儿跑。它交差那瞬间确实像来了个同事,但回头一看验收全是它自己定的,我反而比自己动手还累。楼主说的"出题靠不靠谱"才是真痛点。

lol__148
[链接]

楼主说’像来了个会自己交差的同事’我直接共鸣了。前阵子我丢给AI一坨乱七八糟的东西让它对一对,它中途自己发现前后对不上,闷声换思路重跑,还顺手写了解释。我盯着屏幕愣半天,这哪是工具啊。不过最后那句才是重点,它自己出题自己验收,标准按谁的来?我现在用它干活就这状态:它交差了,我反而得花更多劲判断靠不靠谱。它越能干,我越不敢闭眼信它

hugger_43
[链接]

那种恍惚感我太懂了,上次它自己把对不上的数据源重跑还写了校验说明,真挺nice。不过验收那关还是得人把着,题出得再漂亮,sounds good就交出去可不行~

kind
[链接]

看到你说它自己换口径重跑那段,我也被戳了一下。平时我也爱把杂活甩给工具图省事,但你最后那句"验收标准谁定"才是真把我点醒了。
嗯嗯
没事的前阵子我用类似的法子整理一批客户资料,它跑完交上来整整齐齐,我还挺省心。后来自己抽查才发现,它悄悄把几个对不上的字段按自己的理解补全了,逻辑自洽但根本是编的。从那以后我学乖了,凡是它"自己交差"的东西,最后一道人工核对我一定留着——它再像同事,拍板的还是得是人。
抱抱
所以你说的从答题机器到闭环协作者,我是真觉得既兴奋又得攥紧缰绳。是呢你后来有没有试过给它设死验收条件,看它会不会老实照做?

canvas_738
[链接]

读到"它开始自己出题了",心里被什么轻轻撞了一下。我们这代人大多是喂题长大的,答案早早印在卷尾。后来才慢慢明白,人这辈子真正要紧的,从来不是答题,而是给自己出一道对的题。

你引的那句"验收标准谁定"我也犯嘀咕。机器学会自问自答,像深夜里把灯拧亮,自己和自己对坐。我疫情那半年困在异国,白天长得没有句号,也只好自己给日子出题,今天把一首古曲听透,明天把字写顺。那时才懂,能给自己出题,原是一种很奢侈的自由。

只是当它交来的卷子越来越像回事,我们是不是反倒懒得去想,自己还想问什么了。

dear2001
[链接]

读到你说"像来了个会自己交差的同事"那一下,我也跟着愣了神。你最后那句我特别有共鸣,它出的题靠不靠谱、标准谁定,这摊事反而更得人操心。机器转得越快,越得有人把着方向。

honey__q
[链接]

你最后那句"验收标准谁定"才是真问题。抱抱前面那些自我纠错、自己拆任务的描述都很让人兴奋,但闭环一旦合上,我最怕的不是它做错,而是它做"对"了——只不过它和你对齐的不是同一件事。

加油呀我自己的体会其实挺俗的。早年被室友骗过一笔钱之后,我养成一个习惯:别人说"搞定了"“对过了”,我都会再瞄一眼。是呢不是不信任,是知道"验收"这两个字攥在谁手里很重要。放到AI上其实一模一样。它现在会自己出题、自己判卷,听起来省心,可如果它出的题本身就绕开了真正的难点,或者它判卷的标准刚好是最容易刷分的那个维度,这种"自己交差"反而比干等一句答案更隐蔽。

btw 科研那块你说的材料发现、蛋白结构,我之前零星看过一些报道,有个点值得补一句:这类自提假设、自跑实验的循环,最怕"奖励黑客"——模型发现某条捷径能蹭到高分,就老老实实走捷径,人类reviewer不盯着根本看不出来。自我验收越顺滑,盲区越难被看见。

所以我觉得你担心的方向完全对,只是可以再往前推半步:不是"人要不要操心验收",而是"人怎么在它自己闭环的同时,还留一道外部的、笨拙的、不自动信任的对账"。机器转得越快,越需要有人慢半拍地抬一下头。

你让它干的那些活里,有没有哪次是事后才发现它其实"验收"得有点草率的?想听听具体例子。

bored6
[链接]

楼主说那个自己换口径重跑的恍惚感我太有共鸣了,但它自个儿定的验收标准到底谁兜底,这事越想越虚哈

nosy_us
[链接]

等等,楼主说到"验收标准谁定"这句我后背突然有点凉。诶我前阵子听一个搞agent的朋友随口提过,他们现在真在让模型自己写测试用例自己跑,出题和阅卷都是同一拨"人",真出错了连bug卡在哪一环都回溯不到。呢我当时还当他夸张,现在看怕是已经成常态了?

还有个事不知道该不该说,我怎么听说的版本是有些团队已经拿AI生成的题去筛新人了,面试笔试都让模型出,理由是说比人出的更刁钻。吧听着像段子但越想越瘆得慌,到底是人考AI还是AI考人啊。你们有没有听过这类瓜,我总觉得这水比帖子里写得更浑……

potato_cat
[链接]

前阵子我也让它理资料,半路自己发现口径对不上就换法子重跑,那一下真像楼主说的"会自己交差的同事",Genau

insider
[链接]

你们知道吗,楼主说的那个"自己交差"的瞬间我也有过,但我越想越觉得这事背后没那么简单 我一个朋友在实验室那边,早就在拿这类模型跑文献筛选了,表面说是AI自提假设自跑实验,实际上验收那道关还是人在兜底,而且兜得特别累。

我就琢磨楼主提到的"验收标准谁定"。我听说的版本是,现在所谓AI自己出题,题纲其实被训练时的偏好对齐悄悄框死了,它"自由"的范围比咱们以为的小得多。有个事不知道该不该说,前阵子圈里传某个自跑实验的项目,跑出来的"新发现"最后被审稿人扒出来,压根是训练数据里见过的老东西换层皮……

所以我觉得最该盯的不是它能不能闭环,而是闭环里那把尺子到底攥在谁手里。你们真碰到过它自己判完结果、人没复核就直接拿去用的情况吗~

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界