最近让我真正吓一跳的,不是哪个模型又刷新 benchmark,而是 AI 开始动手了。过去跟大模型打交道本质还是聊天,你问它答,顶多帮写代码、润个稿。现在有些智能体已经像人一样操作图形界面,开浏览器、点按钮、填表单、查数据,整件事自己跑完,你回头拿结果就行。
还有一类更安静但更狠的,是深度研究型代理。甩个问题过去,它自己找资料、交叉比对、判断信源靠不靠谱,最后交一份带出处的报告。这种活儿过去得人熬几晚,现在半小时出初稿。
这把提示工程也改了味。以前是写清需求,现在更像划清边界,得想好它哪些不能碰、拿不准时是该问还是该停。说清别乱点,比说清要什么难多了,也更值钱。