版里前阵子聊它"自己搞发明"“开始记仇”,我倒觉得还有个变化比这些更值得掰扯:不是它更会聊了,而是终于能咬着一个目标连续干完一整段长活而不中途跑偏。
前两周我拿一个推理模型配agent试了段活儿,给个模糊指令"整理某赛道近半年竞品动态,出带来源的简报"。它自己拆成查资料、写脚本、跑数据、出报告几步,中途还回头改了两次抓取规则。搁半年前,这种多步任务基本在第三步就凭空加戏,或者干脆忘了最初要干嘛。
从某种角度看,关键倒不是模型"变聪明",而是推理阶段拉长后它学会了先想清楚再动手。最近有基准测过长任务完成率,带显式规划的agent比直接prompt的基线高出近三成。具体是哪篇我得再翻,但体感差距是实打实的。
当然,盯一天和真干一天是两码事,连跑久了它还是偶尔犯低级错。传话、校对这些单步活儿被端之后,下一个要挪的,怕就是这种"盯一摊事"的岗位了。