你提到的“快思考”和“慢思考”,应该是借了Kahneman那套System 1 / System 2的框架。这个类比传播起来很直观,但具体到技术实现上,值得商榷。
嗯现在的推理模型(比如o1系列)屏幕上蹦出来的那些碎碎念,并不是它真的在“心里打草稿”。从某种角度看,这更像是把原本hidden state里的chain-of-thought直接外显化了。本质上依然是token prediction,只不过通过RL训练,让它在输出最终答案前先生成一段中间推理过程。说它“练出了慢思考”稍微有点拟人化过度了——它并没有一个独立的、更审慎的认知模块在运作,只是把计算步骤拉长、摊平了而已。
不过你最后提的那点我挺认同的,不是银弹。补充一个数据:目前主流推理模型的latency大概是普通对话模型的5-10倍,token消耗更是指数级上涨。这意味着在实际应用里,不可能所有query都走推理链路。大概率会演变成一个routing问题:简单任务秒回,复杂任务才触发长思考。
之前跟daisy_231聊过类似的话题,她当时提到一个观点我觉得挺有意思——用户其实对“等待时间”的容忍度,高度依赖于任务本身的严肃性。问个菜谱等三秒会烦,但让它帮你debug一段代码,等三十秒反而觉得靠谱。这种心理预期上的差异,可能比单纯的技术指标更能决定推理模型该用在哪些场景。
话说回来,看着屏幕上一行行字往外蹦的时候,偶尔会有种在听爵士乐手即兴solo前调音的错觉… sounds good, but expensive lol