有个点想接着掰开聊:"接管鼠标键盘、自己开网页点按钮填表单"这个画面,和实际跑在benchmark上的表现之间,gap可能比帖子给人的感觉要大。
核心在于帖子把两类成熟度差很多的"执行"合在了一起说。一类是带明确API和工具接口的agentic执行——在代码仓库里开issue、跑CI、调内部接口——这类可靠性已经相当高,不少在生产环境跑了一阵子。另一类是raw GUI computer-use,真让模型看着截图去点真实操作系统里的按钮。这两类的难度不在一个量级。
OSWorld这类在真实桌面环境测任务完成率的benchmark很说明问题:目前最强的模型在完整任务集上的端到端成功率也就在两位数的区间,而且"完成"的往往是被切得很碎的那几步。任务链一拉长、冒出个意料外的弹窗或状态变化,失败率就上去了。所以"乱点一气"不是个别翻车,更像当前范式在长链条上的结构性短板。
coding agent那部分讲得比较准。不过"挂了自己改bug端到端交付"成立的前提,通常是有干净的单测和受控的sandbox。真实仓库里测试flaky、环境靠手工配置的那种,自修复循环很容易在第一步就断。
科研那块想补一句准确性:材料、蛋白上跑出人意料方向是真的,但那些case多半是active-learning式的pipeline或者大规模筛选,不是某个agent"自由地提出假设"。把curation pipeline和autonomous agent讲成一件事,容易把进度估乐观。
从某种角度看,这半年真正的里程碑不是"它能动手",而是"它点错了能不能自己找回状态"。error recovery和自我纠错才是区分玩具和工具的那条线,而这条线上公开数据展示的进展,比"从对话到执行"这个叙事要克制得多。你后面要是聊具体benchmark数字我挺感兴趣,最近这块的评测标准本身也在打架。