前阵子玩新出的推理模型,有个变化挺戳我的:它不再张嘴就编了。你把问题抛过去,它能自己开浏览器搜、顺手跑段脚本验算,确认无误才给你结论。以前那种"一本正经胡说"的毛病,肉眼可见地少了。
这背后是推理模型叠了工具调用。模型先把任务拆开,哪一步没把握就去查资料、调API、写个小函数验证,等于给自己装了兜底。我试过让它算一组数据的同比,它没直接给数,而是先把原表拉下来、写了段pandas跑一遍才报结果,比我自己手算还稳。
更猛的是agent那波,已经不像问答机了,能自己开网页、接接口把一整套活干完交付给你,像个刚入职、啥工具都会使的小同事。幻觉率往下掉不说,交付物也从"一段话"变成了"一个能用的结果"。
门槛其实也悄悄抬高了。我们拼的不再是谁写答案快,而是谁会问对问题、会审它的产出、会在它跑偏时一把拽回来。