说真的,用了快二十年各种聊天机器人,今年最让我愣住的不是哪个模型画画更逼真了,而是这帮家伙开始"装深沉"了。以前问它一道数学题,它秒回,答得飞快,错得也飞快,像那种抢着举手然后答错的同学。现在倒好,o1、R1这类推理模型上来先沉默半天,屏幕上噼里啪啦刷一堆内心戏,自我怀疑、推翻重来,最后才慢悠悠给你个答案——而这个答案往往是对的。
这事儿妙在哪?妙在提示工程的玩法整个变了。以前我们琢磨怎么把问题描述清楚让它别跑偏,现在是琢磨怎么引导它的推理过程,从"给答案的人"变成了"给思路的教练"。太!当然代价也明显,慢、贵,等它一道题的时间够我泡杯茶。但复杂任务上正确率的提升是真金白银,感觉从雇了个打字快的实习生,升级成多了个会琢磨的同事——虽然这个同事思考的时候有点啰嗦。
你们实际用下来,觉得这份"想"的时间花得值吗?