最近调AI有个新玩法,挺好用。简单说同一个问题同时丢给两三个模型,让它们互相审、互相挑刺,最后再让其中一个当裁判汇总。
单问一个模型,它很容易顺着你给的预设往下走,你问得偏它就答得偏,幻觉和片面性全藏在里面。多开几个对话并行跑,等于做了一次交叉验证(cross-validation,就是拿多个结果互相印证),哪个结论站不住一眼就能看出来。
更省事的是让它们自动red teaming——红队测试,专门找对方论证里的漏洞。最后把几轮交锋喂回其中一个,让它挑出最稳的那版答案,零成本,不用你一个人肉审稿。
我一般同个问题开三个窗口,prompt一模一样,省得哪边被我措辞带偏。试下来比死磕单个模型稳不少,尤其写方案做判断的时候。你们有更野的玩法没?