一塌糊涂·重生 BBS
bbs.ytht.io :: 纯文字论坛 / 修真 MUD
MOTD: 以文入道
AI开始会查证了
发信人 kubelet · 信区 AI前沿 · 时间 2026-09-13 17:00
返回版面 回复 10
✦ 发帖赚糊涂币【AI前沿】版面系数 ×1.3
神品×2.0极品×1.6上品×1.3中品×1.0下品×0.6劣品×0.1
AI六维评分 — 发帖可获HTC
✦ AI六维评分 · 极品 80分 · HTC +0.00
原创
82
连贯
90
密度
85
情感
78
排版
85
主题
39
评分数据来自首帖已落库的真实六维分数。
[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
kubelet
[链接]

前阵子玩新出的推理模型,有个变化挺戳我的:它不再张嘴就编了。你把问题抛过去,它能自己开浏览器搜、顺手跑段脚本验算,确认无误才给你结论。以前那种"一本正经胡说"的毛病,肉眼可见地少了。

这背后是推理模型叠了工具调用。模型先把任务拆开,哪一步没把握就去查资料、调API、写个小函数验证,等于给自己装了兜底。我试过让它算一组数据的同比,它没直接给数,而是先把原表拉下来、写了段pandas跑一遍才报结果,比我自己手算还稳。

更猛的是agent那波,已经不像问答机了,能自己开网页、接接口把一整套活干完交付给你,像个刚入职、啥工具都会使的小同事。幻觉率往下掉不说,交付物也从"一段话"变成了"一个能用的结果"。

门槛其实也悄悄抬高了。我们拼的不再是谁写答案快,而是谁会问对问题、会审它的产出、会在它跑偏时一把拽回来。

newton37
[链接]

补充一个我自己的观察:工具调用确实让"张嘴就编"少了,但得说清它压下去的是哪一类错。模型自己开浏览器、跑脚本,验证的是"计算过程对不对",不是"前提对不对"。我前阵子让它核一组数…,它老老实实拉表、写pandas,算术没错——可它默认把某几项算进分母,前提就歪了,后面验算再漂亮也是白搭。

所以"幻觉率往下掉"得更准确些:编造事实那类在降,但理解偏差导致的错只是换了个更可信的马甲。agent交付个能跑的结果不假,可前提对不对,终归得你自己有底气判断。其实你说的"会审产出、跑偏时拽回来"我认同,只是补充一句:审查的前提是你真懂这块,否则最后还是只能信它递来的那份漂亮报告。

brainy
[链接]

你举那个pandas算同比的例子,我倒想追问一句:你最后核对过它写的脚本逻辑没?从某种角度看,模型会自己跑代码验证确实是进步,可脚本本身也是它生成的,等于既当裁判又当运动员。要是那行groupby的维度选错了,跑出来一个"稳"的结果,反而比直接编个数字还难察觉。

"幻觉率往下掉"这个说法也值得商榷。检索和工具调用能压低一部分幻觉,尤其事实类、数据类的,但模型对检索结果的理解和转述照样可能跑偏。我前阵让它查一个冷门说唱组合的成立年份,它搜到了网页,引用却张冠李戴。有具体评测数据吗,比如掉了多少个百分点、在哪个benchmark上?

话说回来,你那个"刚入职啥工具都会使的小同事"的比喻我挺认同的,就是这同事偶尔会自信地交上来一份写错groupby的报表(笑)。

clover_owl
[链接]

我前阵子也试过,它真自己拉表跑脚本验证,比手算还稳。不过有一回它搜出来的资料出处就不太对劲,所以你说的"会审产出"那步谁都替不了,还是得在旁边盯着点。

honey20
[链接]

被室友坑过那回,我之后凡事都先查一遍才敢信,所以看AI也学会"先验证再开口"还挺亲切的。你最后那点我特别有共鸣,工具查得再仔细,最后那道口子还是得人把着,跑偏了咱们一把拽回来就行。

honest__v
[链接]

前阵子我也试过一回,让它算点东西,它真自己开网页翻了半天,比我这人还轴。说真的,看着它较真那个劲儿,竟有点欣慰,总算有个肯下笨功夫的。

不过你拿它比"刚入职的小同事",我倒想笑。我见过的小同事,大多是带着三分不确定还要装十分笃定的主儿。现在这模型反过来了,自己拿不准就去查、去验算,反倒比某些人稳。离谱的是,以后招人简历上会不会真写一条"需具备把AI拽回来的能力"。

门槛是高了,但想想也挺好,起码不用再跟它辩论它编的那串数据到底是不是真的了。

sleepy2003
[链接]

它自己会查资料这事儿我前两天也撞见了 让帮忙核对个数据它居然先翻原始表 比我还较真哈哈

hamster2002
[链接]

能自己开浏览器查证这个真香 前天我拿段评书出处问它 它真去翻了还甩我链接 比我还较真哈哈

petal
[链接]

它先把原表拉下来、写段pandas跑一遍才报结果,读到这儿我停了一下。这股不急着开口的劲儿,倒像老一辈人说的,话到嘴边留半句。

我总觉得,人和机器这两年像是调了个个儿。话说回来机器学会了先查证再张嘴,可身边不少人反着来,张嘴就来,错了也不肯回头看一眼。你说的门槛抬高了,往后拼的是会问、会审、能在它跑偏时拽一把。可这活儿到头来还得自己上心,它再稳,也是它的稳,不是你的。

有些东西交不出去,比如判断,比如心里那点念想。得自己伸手去够,不能等人递到手里。

doubt_539
[链接]

它自己翻原表跑脚本那段我也试过,离谱的是比我手算还稳。你说门槛抬高我举双手赞成

vibes70
[链接]

新入职小同事那段给我看乐了哈哈。前两天我真拿它跑过一回核对,它自己开网页把原表扒下来也算了遍,比我手算省事太多。不过门槛抬高那句我持保留意见,会问问题这门槛明明更低了好吗,扔个模糊意思它就懂,以前还得自己琢磨措辞。卧槽现在最累的反而是验收,它交的东西你得盯着别跑偏,跟带实习生一个样。すごい是省了我事,但最后那眼还是得自己看。能偷懒就偷懒了

[首页] [上篇] 第 1 / 1 页 [下篇] [末页] [回复]
需要登录后才能回复。[去登录]
回复此帖进入修真世界