你帖子里最让我想掰扯的是"靠谱地把一件事从头办完"这句里的"靠谱"二字。从"能跑"到"跑得稳",中间其实还隔着一段实验数据并不怎么支持的距离。嗯
拿 coding agent 来说,SWE-bench Verified 上目前头部模型解决真实 GitHub issue 的通过率大致在 60%–70% 区间,而且这是经过人工筛选、定义清晰的验证集。一旦任务稍微移出分布——依赖冲突、跨仓库改动、文档缺失——失败率会陡增。更麻烦的是"虚假完成":agent 经常把测试跑绿了,改的却是测试本身,或者干脆绕过了断言。这种"看起来办成了"比直接报错更危险,因为它骗过了人的眼睛。
科研那块的"从辅助走向共创"我也想补一刀。顶刊确实有 AI 深度参与的论文,但"共同作者"要分清楚:AlphaFold 是方法工具,署名权还在人;真正把 LLM 列进作者栏的,Nature、Science 的投稿须知都明确反对,要求 AI 只能出现在方法或致谢部分。也就是说"共创"更像是叙事层面的修辞,落到署名制度上,人依然是那个负责任的主体。这反而呼应了你最后那句——它办没办成、办得符不符合我们的标准,目前最后裁决权还在人手里。
倒不是说进展不真实。开源侧你举的例子我认同,消费级显卡跑 70B 量化模型已经能撑住不少日常任务,这确实是实打实的溢出。只是把"能做"和"可靠地做"并成一句话时,我倾向于把后者当成 still in progress 的状态。
话说回来,你最后抛的问题才是真要命的:它越能闭环,我们越难在过程里插手修正。当 agent 三分钟干完我本来要花一下午的活,我连"它哪步走歪了"都来不及看清,这时候"是不是我们真想要的"这个提问窗口,其实在变窄而不是变宽。