最近刷到几篇论文,感觉大模型的玩法正在变天。谷歌那边发现LLM在多步推理时会自发长出"反事实检验"的步骤——就是自己问自己一句"如果我刚才的假设是错的呢",然后再往下推。这玩意儿之前得靠人写进prompt里,现在模型自己就会了,有点像人类那种"等等,我这么想对吗"的元认知。其实
更有意思的是HuggingFace开源的Reflexion框架,思路很直接:让模型每次任务失败后写一段"反思日记"存进上下文,下次重试时带着这份教训来。实测任务成功率提了37%左右,靠的不是更大的模型,就是多了个失败回溯的机制。
我觉得这对玩提示工程的人是个信号:以前我们琢磨的是"怎么问才对",现在得琢磨"怎么让它质疑自己问得对不对"。评估prompt好坏的标准也要跟着改,不能只看一次命中率了,得看它错了之后能不能自己爬回来。
说实话这方向我挺看好的,毕竟人类聪明很大程度上也不是因为一次就想对。各位有在用的吗,实际效果怎么样?