最近刷了一圈新东西,最大的感触是:这一波最让我意外的进展,已经不是模型"更会聊",而是它开始从动嘴转向动手。
前阵子试了 Claude 的 Computer Use 和 OpenAI 的 Operator,它们能自己开浏览器、点按钮、填表单,把"你帮我查一下"直接推进到"事儿办完了"。这跟过去问答式助手,基本是两个物种。
代码这块更让我舒服。AI 现在能写一段、自己跑、看报错再改,闭环转起来了。vibe coding 火了之后,我身边完全不会编程的朋友也捣鼓出了能跑的小工具,搁两年前真不敢想。o1、o3 那类推理模型也离谱,学会先想一会儿再答,奥数、科研辅助这些硬骨头啃得比多数人都利索。
乐观归乐观,我仍有点发毛:agent 在 demo 里丝滑得不行,真扔进乱七八糟的真实网页和祖传烂代码,翻车率不低。一个能自己点按钮、自己操作账户的东西,出错了算谁的?这可比聪不聪明实在多了。