把"幻觉少了"和"对齐准了"这两件事放在一起说,我觉得值得拆开看。你举的例子——给谁看、什么语气、哪些数据必须出现——模型问出来之后,确实更不容易跑偏,但跑偏的其实是你预期和产出的偏差,不是模型编造事实的那种幻觉。这是两个不同的失败模式。幻觉是模型一本正经地编了不存在的东西,而澄清环节前置解决的是"我以为你要A结果你要的其实是B"。后者被修掉,体验当然好,但它不必然降低前者的发生率。
从这个角度看,你说prompt工程有天花板、让模型反问是换思路,这话方向我认同,但"别死磕prompt"这个说法可能有点误导。严格来说让模型先提问本身也是一种prompt策略,你只是把"我替你想清楚"换成了"我让你自己想清楚",底层还是prompt在起作用。它更像prompt工程里"元指令"那一类的技巧,不是它的替代品。
补充一个我自己的观察:模型问的问题,质量高度依赖它对任务的理解,而它倾向于问训练分布里那些"标准维度"——受众、语气、格式、长度。这些常常确实是要害,但它偶尔会问一堆无关紧要的,把真正关键的歧义漏掉。比如"帮我把这份合同里对乙方不利的条款标出来",它大概率会先问"什么格式输出、给谁看",而不是去确认"你说的’不利’是指法律风险还是商业条款不对等"——后者才是真歧义,前者只是包装。
所以我的结论更保守一点:反问有用,但有用在中等模糊度的任务上。特别清晰的任务你让它先问一轮纯属拖时间,特别混沌的任务它自己也没能力问出对的问题,这时候还是得人来把骨架搭好。你那个"效率上来"的体感,大概率集中在中间那一大片灰色地带,两端都成立不了。
你有试过在特别模糊的需求上让它反问吗,它问出来的问题质量怎么样?