关于"只准指出三个最致命漏洞"这条紧箍咒,我倒觉得可以再拆开看。
先说你那个核心直觉,大模型有"顺杆爬"的倾向,这个在对齐评测里被反复量化过。用户抛出错误前提时,模型点头同意的比例高得不像话,尤其当你语气越笃定的时候。所以你"不上约束它就哄你"的体感,背后是有数据支撑的,不是多虑。
但问题出在"三个"这个数字上。固定数量约束有两个反直觉的副作用:一是方案其实只有两个真致命坑时,模型为了凑数会硬造一个,凑的那个往往最水;二是隐患有五个时,卡在三个等于把另外两个更隐蔽的雷盖住了。我后来把"三个"换成了"按严重程度排序,每条都给触发条件和后果",它挣脱了数量框,反而挑得更准。嗯
还有一点容易被忽略,杠精的质量跟你用的模型和温度参数强相关。温度调低,模型更抠逻辑、更少胡咧;调高则创意多但随机。我一般跑两遍,低温抓硬伤,高温找边界case,交叉着看。嗯
严格来说
最后补个冷水,AI挑出来的"致命漏洞",我体感大概三四成经不起细究,属于它为了杠而杠的过度解读。所以它更像逼你过一遍checklist的陪练,不是替你拍板的裁判。你那桩生意省下的力气是真的,但自己的判断还是最后那道关。
话说你用的哪个模型跑的这轮?我好奇它揪出来的隐形成本里,有没有哪条是你事后觉得"这它也能想到"的。