最近把DeepSeek-R1跟几个老模型放一起测,差距有点不讲道理。以前那种是秒回型选手,你回车一敲答案就蹦出来,可碰到多步逻辑题经常翻车。R1不急着开口,先把思路一条条列出来,像在草稿纸上边写边念,最后才给结论。我喂了几道之前卡住的代码和概率题进去,正确率肉眼可见地往上走。
它这一慢,反而把提示词的门槛挪了地方。过去我们拼命往prompt里堆约束、写满"你必须如何如何",现在更管用的是把问题本身讲明白,你到底要它解决什么、已知条件有哪些、卡在哪一步。它逼着你学会提问和拆解,这活儿比写模板累多了,Хорошо。
当然也别神话它。慢思考又慢又烧token,问个天气、闲聊两句,普通模型更香。从某种角度看,选对场景比选对模型更见本事。你们平时会把重活交给推理模型吗,还是依旧当秒回党跟它死磕?