最近几个reasoning model配上tool use,体验跟去年完全不在一个量级了。以前问AI,它大多回你一段漂亮的话,顶多附段伪代码;现在把一个模糊目标丢过去,它能自己拆步骤、查资料、改代码、调接口,一步步把事跑通。更让我在意的是computer-use那类Agent,已经能像人一样去点按钮、填表单、在软件里自己操作,而不只是吐文本。
上周我试着把积压的一堆杂活全交给它:整理几个表格、跑一遍数据、写几封措辞麻烦的邮件。本以为得在旁边盯着纠错,结果它自己把流程串起来了,我只中途确认了两次。一周下来省下的时间真不是一点点。
从某种角度看,这已经不是"问答机"到"执行者"的修辞变化,而是工作方式的实质位移。可靠性当然还谈不上完美,复杂任务该拦的还得拦。但抛开宏大的AI for Good叙事,它先把最朴素的"替人省时间"这件小事做实了。你们最近有类似经历吗?