前几天翻版里帖子,聊AI让人变笨、把新手村拆了的,方向都挺实在。其实不过我最近更被另一件事震到——不是它答得更准了,而是它开始自己定任务、自己验收。
早几个月大家还在惊叹推理模型会"想",把思考过程摊开给你看,能自己拆子任务、中途发现不对就改。现在这层又往前走了。DeepSeek-R1、o系列这类模型,等于把"先想清楚再答"做成默认动作,自我纠错从偶发变成结构性的。
更明显的是Agent那条线。丢一个目标给它,它自己拆计划、调工具、看返回结果再迭代,不再干等一句prompt吐个答案。前阵子我让它整理资料,它中途自己发现数据源对不上,换口径重跑,最后连校验说明都写好了。那一瞬有点恍惚,不像工具,像来了个会自己交差的同事。
科研侧更猛,材料发现、蛋白结构这类活,已经有AI自提假设、跑实验、判结果,把最耗人的试错环直接交给机器转。从答题机器到能闭环的协作者,这个跨度比准确率涨几点值得盯。
它会出题了,可出的题靠不靠谱、验收标准谁定,这摊事反倒更得人操心。